阿里云开源百炼 CLI,Agent 可调用全套模型和应用能力
15:21 IT之家(RSS) 精选 70 智能体 MCP/工具 产品更新 推荐理由: 阿里云把百炼的全套能力打包成 CLI,Agent 开发终于不用再一个个接 API 了,做企业智能助手的可以试试。
AI and technology watch
聚合过去 24 小时 AI 与开发者生态动态,并提供来源链接以便深入阅读。
15:21 IT之家(RSS) 精选 70 智能体 MCP/工具 产品更新 推荐理由: 阿里云把百炼的全套能力打包成 CLI,Agent 开发终于不用再一个个接 API 了,做企业智能助手的可以试试。
17:21 IT之家(RSS) 精选 74 小米大模型应用团队发布开源可控视频音效生成模型 ControlFoley,旨在解决创作中的可控性难题。该模型统一支持文本引导视频配音、文本控制视频配音和参考音频控制视频配音三类任务。ControlFoley 在 VGGSound-Test 等多个 benchmark 上取得开源 SOTA 表现,其代码、模型权重和在线 Demo 均已开放。 多模态 开源生态 模型发布 语音 推荐理由: 小米开源的 ControlFoley 把视频音效生成从“看画面配声音”推进到“按意图来”,开源 SOTA 且直接提供 Skill,做视频创作的可以上手试试。
18:50 OpenAI:官网动态(RSS · 排除企业/客户案例) 精选 58 OpenAI 推出 Rosalind Biodefense,为通过审核的开发者和美国政府伙伴提供 GPT-Rosalind 的可信访问,以推动前沿 AI 在生物防御、公共卫生和大流行病准备方面的应用。 OpenAI 产品更新 推荐理由: 又一个OpenAI限定合作伙伴的产品发布,GPT-Rosalind聚焦生物防御,普通开发者暂时用不上,但给前沿AI在公共健康领域的落地开了扇窗。
11:29 HuggingFace Daily Papers(社区热门论文) 精选 73 针对现有基准无法精确诊断多模态智能体记忆在动态环境中的具体失败阶段,研究提出了“行动-世界交互循环”记忆模型,并构建了WorldMemArena基准。该基准包含400个多会话多模态任务,涵盖“终身进化”和“智能体执行”两类场景,支持对记忆写入、维护、检索和使用的阶段级评估。研究首次对长上下文、RAG等手工设计系统与基于框架的记忆智能体进行直接比较,发现记忆写入与存储质量的提升不直接带来性能改善,且多模态记忆在利用视觉证据及跨领域稳定性上仍存在挑战。 智能体 多模态 论文/研究 评测/基准 推荐理由: 首个能定位多模态 Agent 记忆“写、维、取、用”哪一步出问题的基准,头对头比较长上下文、RAG 和自管理记忆,结论是写得好未必用得上,做 Agent 的值得认真看。
12:34 Berryxia.AI @ berryxia 精选 75 FaceMind团队用100种语言和四大核心任务实验发现,在语义不变的前提下,使用预训练语料中出现频率更高的词汇(高频表达)来撰写提示词或进行微调,可以显著提升大语言模型的表现。这被总结为Adam’s Law(文本频率定律),它为数据工程补上了“频率”这一新维度。原理在于高频表达能让模型在它最熟悉的概率空间内工作,从而优化输出质量。 Berryxia.AI : http://x.com/i/article/2044264645683539968 教程/实践 数据/训练 推荐理由: 别再给AI拽高级词汇了,FaceMind团队用实验证明,高频表达能让模型表现更好。这个发现简单反直觉,但能立刻改变你写Prompt的习惯,下次先想想这话模型见过几次。
14:30 HuggingFace Daily Papers(社区热门论文) 精选 71 扩散模型的生成轨迹具有频谱偏差,早期处理低频全局结构,后期处理高频细节。传统随机微分方程求解器在整个过程中均匀注入白噪声,能量分配效率低。本研究提出彩色噪声采样(CNS),一种免训练的即插即用采样器。它通过动态、随时间和频率调整的噪声调度,更高效地将能量分配给尚未解析的频段。在SiT、JiT、FLUX等架构上的实验表明,CNS作为推理时的替换采样器显著提升了生成质量:在ImageNet-256上,无引导FID在SiT-XL/2上从8.26降至6.27,在JiT-B/16上从32.39降至26.69,在JiT-H/16上从11.88降至8.31,并且在使用无分类器引导时带来一致改进。 图像生成 论文/研究 推荐理由: 扩散模型采样时的白噪声注入一直很粗糙,这篇论文用动态调制的有色噪声把能量怼到未解析的频段,在多个模型上 FID 直接骨折,而且完全训练无关,拿来就能用。
06:09 Hacker News 热门(buzzing.cc 中文翻译) 精选 76 Anthropic OpenAI 大佬观点 现象/趋势 推荐理由: Altman和Amodei同一周改口,从‘大量失业’变成‘需要适应’,风向标意义拉满。过去拿AI末日论吓人的可以歇歇了,这篇值得转给每一位焦虑的朋友。
07:36 OpenRouter @ OpenRouter 精选 68 产品更新 评测/基准 推荐理由: OpenRouter 这个对比页把 GPT-5.5 和 Claude Opus 4.8 的胜负判断从 benchmark 拉到实际测试,对选型的人很有用。
08:09 StepFun @ StepFun_ai 精选 75 阶跃星辰(Step)发布了开源大模型 Step 3.7 Flash,主打智能体(Agent)工作流的效率。该模型在 ClawEval-1.1(67.1分)和 SimpleVQA Search(79.2分)评测中排名第一。其架构为 198B 参数的 MoE,约 11B 为活跃参数,支持 256K 上下文。模型具备多模态理解能力,能处理图像、文档并生成代码或调用工具执行任务。在工具使用方面,它致力于高可靠性,τ²-bench 得分超过 98%。Step 3.7 Flash 兼容 Claude Code、MCP 协议等工具链,并支持在 Mac Studio M4 Max 等设备上本地运行。模型权重以 Apache 2.0 许可开源。 智能体 多模态 开源生态 推理 关联讨论 3 条 X:阶跃星辰 StepFun (@StepFun_ai) IT之家(RSS) X:OpenRouter (@OpenRouter) 推荐理由: Step 3.7 Flash 把 Agent 效率卷到新高度,开源权重且能跑在 Mac 上,做智能体的可以试试。
08:41 Simon Willison 博客 精选 72 llm-anthropic 发布 0.25.1 版本。主要更新包括:新增 Claude Opus 4.8 (`claude-opus-4.8`) 模型;为账户启用了该功能的组织新增了 `-o fast 1` 选项以使用快速模式;调整了各模型的默认 `max_tokens` 值,使其直接使用模型的最大输出长度,而非固定的 8,192。 Anthropic GitHub 产品更新 开源/仓库 推荐理由: Simon 的 llm 插件第一时间支持了 Claude Opus 4.8,如果你用他的 CLI 工具切换模型,这次更新能让你马上用到新模型和 fast mode。
09:21 IT之家(RSS) 精选 71 特斯拉声称其全自动驾驶软件(FSD)安全性最高可达人类的10倍,但路透社调查发现此数据经不起推敲。参与训练FSD的员工表示该技术远未成熟,其安全演示高度依赖人工。统计方法被11位交通安全研究人员指出存在缺陷,例如与更广泛的联邦事故数据进行不恰当比较。相比之下,竞争对手Waymo采用了更严谨的统计方法。目前,特斯拉FSD仍需驾驶员主动监督,安全部署可能还需数年。 安全/对齐 行业动态 推荐理由: 路透社的调查锤得很实,特斯拉FSD的「10倍安全」根本经不起对比,连自家数据标注员都不敢坐。这是今年自动驾驶行业最响的一记警钟。
09:21 IT之家(RSS) 精选 71 数据/训练 行业动态 推荐理由: 三星的HBM4E把单堆栈带宽推到3.6TB/s,能效再提16%,对LLM训练是实打实的硬件升级,做AI基础设施和模型训练的可以关注后续量产时间。
09:39 meng shao @ shao__meng 精选 75 报告显示,AI正深刻改变开发工作形态。开发者周均代码产出从约3.6K行增至8.6K行,更大规模的PR(千行以上)占比上升。AI智能体在单次会话中的工具调用数增加约30%,正在处理更复杂的任务。同时,被接受的AI代码在60分钟后的留存率从约76%提升至约81%,表明更多AI生成内容进入了实际代码库。这些趋势共同指向AI已从个人辅助工具,演进为推动开发向更大规模任务与自动化基础设施发展的核心力量。 Cursor : Introducing the Cursor Developer Habits Report. We're sharing some of our findings on how software development is changi... 智能体 现象/趋势 编码 推荐理由: Cursor 这份报告用真实数据揭示了 AI 编程的现状,代码量暴涨、Agent 变强、留存率提升,对开发者来说比看论文更有参考价值。
10:44 PixVerse @ PixVerse_ 精选 65 多模态 教程/实践 视频 推荐理由: PixVerse 这条动画演示把‘角色设定到成片’的链条跑通了,虽然大概率还是精选过的案例,但对想做短视频 IP 的人,流程本身就值得抄一份。
04:52 Replit ⠕ @ Replit 精选 74 智能体 产品更新 推荐理由: Replit 终于在对话之外给了设计师一个能迭代的画布,把 Agent 直接塞进设计工具里,对用 AI 做 UI 的人来说比聊天框强太多了。
05:08 xAI @ xai 精选 62 xAI 产品更新 推荐理由: xAI 给 Build 加了使用量查询和共享终端,开发体验向 Cursor 靠拢的一小步,如果你在重度用 Grok Build 可以看看 changelog。
02:48 Ars Technica:AI(RSS) 精选 70 Apple 正尝试将大型 Gemini 模型集成到 iPhone 中,以支持全新的 Siri 功能。由于模型规模庞大,本地处理可能无法完全实现,因此一个云端组件很可能是必然的选择。 Google 端侧 行业动态 推荐理由: 苹果想把谷歌最大的模型塞进iPhone来救Siri,如果真能本地跑,那安卓的端侧AI优势就没了,但蒸馏这么大的模型到手机,技术上挑战不小。
03:06 Google Gemini @ GeminiApp 精选 62 Vijay Choudhary : Gemini Omni seems to outperform everything. Crazy updates for Vibe Video Editing at #google Let's see when this update w... Google 产品更新 多模态 视频 推荐理由: Gemini Omni 的视频编辑终于从实验室走进日常,虽然目前只对印度开放,但这一步验证了 Omni 在视频创作上的实用下限,做视频的人可以提前关注。
03:22 MiniMax (official) @ MiniMax_AI 精选 76 OpenHands : We have also partnered with @MiniMax_AI to provide *free access to agents with MiniMax-M2.7* for a limited time! This is... 智能体 产品更新 编码 推荐理由: MiniMax把M2.7免费接到OpenHands里跑Agent编码,而且限时,这对个人开发者是实打实的免费用机会,不妨上去跑几个任务体验下性价比。
02:44 Rohan Paul @ rohanpaul_ai 精选 75 hexoai开源了SIA(自我改进AI)框架。该框架展示了AI智能体不仅能优化其外部工作流(harness),还能通过任务反馈直接更新自身的模型权重,从而在领域知识和能力上实现自主提升,而非仅依赖人类提供的提示或工具改进。论文报告显示,SIA在LawBench基准上性能提升56.6%,在GPU kernels运行上耗时减少91.9%,在单细胞RNA去噪任务中相比基线提升502%。 Kunal Bhatia : Superintelligence will be built on Self Improvement. Today @hexoai, we're excited to release 'SIA' - an open-source Self... 智能体 数据/训练 论文/研究 推荐理由: 不再只是给AI换提示词,SIA框架连模型自己的权重都更新了,在三个任务里分别提升了56%、502%和91%加速,开源出来会让整个Agent开发范式重新思考。
有任何建议或问题,欢迎告诉我们
感谢您的反馈!