AI and technology watch

AI 新闻

聚合过去 24 小时 AI 与开发者生态动态,并提供来源链接以便深入阅读。

---
AI HOT ·

我们相信 AI 可以成为专属研究伙伴,帮助发现下一个突破。 隆重推出 Co-Scientist:我们最新的基于 Gemini 的多智能体系统,能够为复杂科学问题生成、辩论和演进新颖的假设 🧵

01:31 Google DeepMind @ GoogleDeepMind 精选 61 智能体 Google 产品更新 推理 推荐理由: Google DeepMind 把多智能体系统搬到了科学假设生成上,'AI 科研伙伴'的构想不再只是蓝图,虽然落地还远,但思路值得搞科研的人持续关注。

智能体 Google 产品更新 推理
AI HOT ·

教一个智能体一次工作流,让它在每次重建后都记住。 本教程展示如何使用 NVIDIA NemoClaw 和 OpenShell 部署 NousResearch Hermes Agent,将其连接到 Slack、Outlook、GitHub 和 NVIDIA 开发者论坛,然后将聊天纠正转化为可复用的技能。 私有数据保留在运行时策略之后。学到的技能在部署之间持续存在。

01:30 NVIDIA AI @ NVIDIAAI 精选 71 智能体 MCP/工具 教程/实践 推荐理由: NVIDIA 的官方教程,把代理的「一次教会,永不忘记」变成了可落地的步骤,连 Slack、GitHub 都能接,做 agent 的值得照着跑一遍。

智能体 MCP/工具 教程/实践
AI HOT ·

Claude Code团队实践:智能体编程如何重塑工程组织与流程

00:45 Claude:Blog(网页) 精选 74 在Code w/ Claude SF 2026活动上,Claude Code工程团队分享了将智能体编程设为默认工作方式后带来的流程与结构变革。核心变化包括:规划转向即时(JIT)模式,强调快速原型与反馈;上下文收集变为“先问Claude”;代码审查中Claude处理风格与测试,人工专注于法律、安全等专业判断。新范式下,工程瓶颈从编写代码转向验证、审查与安全维护。 Anthropic 大佬观点 现象/趋势 部署/工程 关联讨论 1 条 X:邵猛 (@shao__meng) 推荐理由: Anthropic 工程总监把 Claude Code 团队流程全晒了出来,从抛弃半年路线图到代码审查只留专家复审,每一步都反直觉但实战有效,工程领导者直接抄作业。

Anthropic 大佬观点 现象/趋势 部署/工程
AI HOT ·

开放模型的繁荣生态

00:37 Tomer Tunguz 博客(VC 分析) 精选 61 根据OpenRouter平台数据,自2025年以来,开放模型使用量显著增长。最新数据显示,开放权重模型产生了69.1%的token使用量,闭源模型为30.9%。新模型的发布会吸引开发者测试,推动token使用量达到新的平台期。开放模型市场内部竞争激烈,领导地位频繁更迭,如DeepSeek的早期优势在2025年末至2026年初被MiniMax与Kimi模型取代,随后MiMo、Qwen、腾讯Hy3、阿里巴巴及Arcee等模型的发布再次改变了份额格局。尽管开放模型目前仍只占推理总量的一小部分,但激烈的竞争与增长表明,开发者正越来越愿意将生产流量路由至开放模型。 开源生态 现象/趋势 推荐理由: 开放模型在OpenRouter上的token份额已到69%,而且每轮新模型发布都会把使用量推上一个台阶,做推理基础设施的应该重视这个信号。

开源生态 现象/趋势
AI HOT ·

特朗普签署修订版AI行政命令,要求自愿预发布审查

00:37 TechCrunch:AI(RSS) 精选 75 在业界反对后,特朗普总统签署了修订版AI行政命令,该命令要求对先进模型进行自愿预发布政府审查,而非强制要求。 安全/对齐 政策/监管 行业动态 关联讨论 1 条 The Verge:AI(RSS) 推荐理由: 特朗普签了缩水版 AI 监管行政令,只要求「自愿」审查,给巨头松绑的意味很明显。但对创业公司来说,政策不确定性还在,别高兴太早。

安全/对齐 政策/监管 行业动态
AI HOT ·

构建应用从未如此简单。 通过 Sites,Codex 可以将你的工作、想法和计划转化为一个交互式网站或应用,你的团队可以通过一个 URL 进行探索、使用和分享。 该功能将首先向 Business 和 Enterprise 计划推出,之后会更广泛地扩展。

00:33 OpenAI @ OpenAI 精选 70 OpenAI 产品更新 部署/工程 关联讨论 1 条 X:Rohan Paul (@rohanpaul_ai) 推荐理由: Codex Sites 让应用构建门槛降到「描述即生成」,对企业团队快速验证想法是实打实的效率提升,但只开放 Business/Enterprise 意味着个人开发者还得等等。

OpenAI 产品更新 部署/工程
AI HOT ·

OpenAI Codex 发布 Python SDK,可直接嵌入应用

00:36 向阳乔木 @ vista8 精选 75 这个有点厉害,Codex 出 Python SDK了。 安装指令:pip install openai-codex 整合到自己的代码中,相当于直接内置了顶级编程和生图Agent? 最关键的是,可以复用 Codex 登录态。 Vaibhav (VB) Srivastav : We just released the Codex Python SDK 🔥 You can now embed Codex directly into your Python apps and workflows! > Start t... 智能体 OpenAI 产品更新 编码 推荐理由: Codex不再是独立工具,现在变成了一个可以嵌入任何Python项目的编程Agent。对于那些想构建自动化编程工作流的人来说,这个SDK是个真正的起点。

智能体 OpenAI 产品更新 编码
AI HOT ·

商汤开源SenseNova-Skills AI办公技能套件

23:05 SenseTime @ SenseTime_AI 精选 81 商汤开源了AI办公技能套件SenseNova-Skills。这是一个为任何技能兼容智能体(如OpenClaw与HermesAgent)设计的开源技能集合,提供四大核心功能:图像信息图表生成(可镜像参考风格)、数据分析(支持多表解析、清洗与可视化)、PPT创建(生成大纲内容并智能排版,输出可编辑文件)以及深度研究(跨学术、技术、社交等多源搜索并生成报告)。该技能套件现已完全开源。 智能体 图像生成 开源/仓库 推荐理由: 商汤掏出了一套开箱即用的 agent 技能包,从做图到写报告都能一键接,而且代码全在 GitHub 上。想做 agent 产品的可以直接 fork 当乐高用,比等 API 发布快多了。

智能体 图像生成 开源/仓库
AI HOT ·

为什么金融机构正汇聚在交易基础模型上来构建自身智能

23:57 NVIDIA AI Blog 精选 69 金融机构正从为每个业务线构建独立AI模型,转向采用基于Transformer的交易基础模型,以统一理解消费者行为并克服数据孤岛限制。NVIDIA报告显示,65%的金融机构已使用AI,近90%正在部署或评估。实践案例包括:Revolut与NVIDIA合作构建了PRAGMA模型系列,在240亿事件上训练,单个模型在信用评分等领域超越特定任务模型;Mastercard正开发专有大型表格基础模型;Adyen的模型处理了1万亿美元支付;Stripe利用相关平台构建模型,去年阻止了近1120亿美元欺诈。 智能体 产品更新 数据/训练 关联讨论 2 条 NVIDIA Blog:Agentic AI(网页) NVIDIA Blog:Generative AI(网页) 推荐理由: 金融机构从散装模型走向统一transformer架构,这次连NVIDIA都给出了可跑的开发者示例,Revolut、Mastercard已经在用了,做金融数据的可以直接上手试试。 23:05 SenseTime @ SenseTime_AI 精选 81 商汤开源SenseNova-Skills AI办公技能套件 商汤开源了AI办公技能套件SenseNova-Skills。这是一个为任何技能兼容智能体(如OpenClaw与HermesAgent)设计的开源技能集合,提供四大核心功能:图像信息图表生成(可镜像参考风格)、数据分析(支持多表解析、清洗与可视化)、PPT创建(生成大纲内容并智能排版,输出可编辑文件)以及深度研究(跨学术、技术、社交等多源搜索并生成报告)。该技能套件现已完全开源。 智能体 图像生成 开源/仓库 推荐理由: 商汤掏出了一套开箱即用的 agent 技能包,从做图到写报告都能一键接,而且代码全在 GitHub 上。想做 agent 产品的可以直接 fork 当乐高用,比等 API 发布快多了。 22:58 OpenAI:官网动态(RSS · 排除企业/客户案例) 精选 69 OpenAI呼吁通过全球领导力推进青年AI安全与机遇 OpenAI呼吁通过设立专门的AI安全研究所,在全球范围内采取行动,以保障青少年在使用AI时的安全,并创造更多发展机遇。 OpenAI 安全/对齐 推荐理由: OpenAI正式发声呼吁成立青少年AI安全研究所,这件事的象征意义大于实际动作,但对所有做教育AI的公司是个明确的信号,青少年保护将成监管重点。 22:40 Hugging Face:Blog(RSS) 精选 73 Holo3.1:快速本地计算机使用智能体 Holo3.1 是基于 Qwen 模型家族的计算机使用智能体系列,旨在提升在桌面、网页和移动环境中的鲁棒性。新模型提供 0.8B、4B、9B 和 35B-A3B 四种尺寸,并首次发布量化检查点,包

智能体 产品更新 数据/训练 图像生成 开源/仓库 OpenAI 安全/对齐 Hugging Face 模型发布 开源生态 行业动态 部署/工程 Anthropic Google 评测/基准 arXiv 论文/研究 现象/趋势 端侧 具身智能 推理 GitHub MCP/工具 政策/监管
AI HOT ·

Gary Marcus:为什么事情终将崩塌

00:22 Gary Marcus:The Road to AI We Can Trust(RSS) 精选 58 知名人工智能批评者Gary Marcus在其关于可信赖AI的专栏中,探讨了人工智能发展面临的根本性挑战。文章开篇即指向问题的核心,指出相关数学理论的局限性与人类心理的复杂性,是导致AI系统最终可能出现问题的根源。 大佬观点 安全/对齐 推荐理由: Marcus用数学和心理学双重框架解释AI信任为何必然崩溃,比他以往只说深度学习不可信更完整,但核心还是那套,做安全的人可以看看有没有新论据。

大佬观点 安全/对齐
AI HOT ·

⚡ 新增服务商:DigitalOcean 的 AI-Native Cloud 现已在 OpenRouter 上线。 提供高性能推理,覆盖热门开源权重模型。在 DeepSeek V3.2 的输出速度和延迟方面排名第一(数据来自 @ArtificialAnlys)。 查看其数据并试用模型:https://openrouter.ai/provider/digitalocean

00:29 OpenRouter @ OpenRouter 精选 68 DeepSeek 产品更新 推理 部署/工程 推荐理由: OpenRouter 新上线的 DigitalOcean 推理服务,把 DeepSeek V3.2 的延迟压到了全场最低,比官方还快,做实时应用的值得立刻切过去试一下。

DeepSeek 产品更新 推理 部署/工程
AI HOT ·

MiniCPM-V 4.6 现已完全支持 vLLM v0.22.0! 无需自定义分支,无需额外编译。 只需拉取预构建包即可运行。 非常感谢 @vllm_project 的顺畅集成! 🤝 🤗 http://huggingface.co/openbmb/MiniCPM-V-4.6

22:21 OpenBMB @ OpenBMB 精选 67 产品更新 部署/工程 推荐理由: MiniCPM-V 4.6 现在 vLLM 原生支持,不用自己折腾编译和环境了,做多模态部署的可以无痛接入,国产端侧模型生态又往前走了一步。

产品更新 部署/工程
AI HOT ·

Nathan Lambert离开Ai2,结束2.5年OLMO等项目工作

22:33 Nathan Lambert @ natolambert 精选 75 Ai2(Allen Institute for AI)研究员Nathan Lambert宣布离职。他在Ai2工作超过2.5年,期间主导或参与了OLMO和Tulu等开源模型项目,称其为职业生涯的巅峰。他表示将暂时休息,未来仍会继续深耕开源模型与开放科学领域。 开源生态 行业动态 推荐理由: Olmo 和 Tulu 的核心推手离开 Ai2,对开放模型圈是个不小的人事地震,他下一步去哪,可能比这条离职声明更值得盯。

开源生态 行业动态
AI HOT ·

Holo3.1:快速本地计算机使用智能体

22:40 Hugging Face:Blog(RSS) 精选 73 Holo3.1 是基于 Qwen 模型家族的计算机使用智能体系列,旨在提升在桌面、网页和移动环境中的鲁棒性。新模型提供 0.8B、4B、9B 和 35B-A3B 四种尺寸,并首次发布量化检查点,包括 FP8、Q4 GGUF 和 NVFP4,以优化本地推理。在 AndroidWorld 基准测试中,35B-A3B 模型得分从 67% 提升至 79.3%。在 DGX Spark 上,NVFP4 量化相比 BF16 实现 1.74 倍 token 吞吐量提升,并将平均步骤时间从 6.8 秒缩短至 3.3 秒。模型支持函数调用协议,可在第三方智能体框架中部署。 智能体 Hugging Face 开源/仓库 模型发布 推荐理由: Holo3.1 把计算机使用代理从桌面扩展到了移动端,还首次放出了量化版,让本地运行真正快了起来。想做 GUI 自动化的开发者可以立刻跑起来了。

智能体 Hugging Face 开源/仓库 模型发布
AI HOT ·

OpenAI呼吁通过全球领导力推进青年AI安全与机遇

22:58 OpenAI:官网动态(RSS · 排除企业/客户案例) 精选 69 OpenAI呼吁通过设立专门的AI安全研究所,在全球范围内采取行动,以保障青少年在使用AI时的安全,并创造更多发展机遇。 OpenAI 安全/对齐 推荐理由: OpenAI正式发声呼吁成立青少年AI安全研究所,这件事的象征意义大于实际动作,但对所有做教育AI的公司是个明确的信号,青少年保护将成监管重点。

OpenAI 安全/对齐
AI HOT ·

Anthropic可解释性研究:区分因果效应相似的特征

17:52 Anthropic:Transformer Circuits(可解释性研究) 精选 63 Anthropic可解释性团队介绍了其Circuits研究的新进展。为区分那些激活模式相似但因果效应不同的模型特征,团队提出一种新方法。该方法通过分析特征的下游连接来预测其实际影响,并使用基于共激活统计的TWERA(虚拟权重)对连接进行加权排序。实验表明,借助下游连接信息能更准确地判断哪个特征会引导特定输出。此方法为识别模型内部真正的因果组件提供了新途径。 Anthropic 安全/对齐 论文/研究 推荐理由: 做可解释性研究的同学值得读,它用下游连接区分看似相同的特征,比只看激活例子更能预测因果作用,对齐审计里能省不少试错。

Anthropic 安全/对齐 论文/研究
AI HOT ·

🚀 AgentScope Java 1.1:构建可自我进化的智能体 ✨ Claw:具备Shell访问权限的本地"MinQwenPaw" ✨ Builder:多租户、零代码企业平台 ✨ 工作区驱动的进化与分布式隔离 从笔记本电脑到集群无缝扩展。👇 https://int.alibabacloud.com/m/1000413896/ #AgentScope #AIAgents #Java

18:06 Alibaba Cloud @ alibaba_cloud 精选 60 智能体 开源/仓库 推荐理由: 阿里云 AgentScope Java 版从「笔记本顺畅扩展到集群」的卖点很实在,自进化和零代码企业平台对 Java 生态的 Agent 开发者是个顺手的新选项,但没啥颠覆性创新。

智能体 开源/仓库
AI HOT ·

NLP领域2018-2025年人类标注报告实践的大规模审计

20:40 HuggingFace Daily Papers(社区热门论文) 精选 71 本研究对NLP领域2018至2025年间的人类标注报告实践进行了首次大规模审计。研究构建并验证了一个LLM辅助提取管线,其在Annotated-gold数据集(41篇论文,72个标注任务)上与人工裁决的一致性(Krippendorff's alpha)达到0.606。基于此,研究构建了Annotated-llm数据集,涵盖ACL会议论文,从1603篇论文中提取了2667个标注任务。分析发现,论文常报告招募策略、标注者专长等操作细节,但经常遗漏评估标注效度所需的关键信息,如培训、语言能力、薪酬、裁决过程及一致性数值。研究指出标注报告虽有改善但仍不均衡,并提出了一个可扩展的框架和最低报告标准。 arXiv Hugging Face 数据/训练 论文/研究 推荐理由: NLP论文里的标注环节一直是个黑箱,这篇首次用大规模数据把各家怎么标注、哪些信息缺失扒了个遍,值得每个做数据和评估的人细看。

arXiv Hugging Face 数据/训练 论文/研究
AI HOT ·

Gemini Spark:最令人印象深刻也最可怕的AI体验

21:02 The Verge:订阅版科技(RSS) 精选 71 Google DeepMind的AI模型Gemini Spark提供了一次极为深刻但同时令人感到不安的用户体验。该模型展现的强大能力令人印象深刻,但其带来的影响和潜力也引发了深刻的恐惧感。 智能体 Google 评测/基准 推荐理由: David Pierce 首次试用 Gemini Spark 的深度体验,一句话概括就是「impressive and terrifying」。它展示了 AI 代理在复杂任务中的惊人能力,但也让人看清未来有多渗人,任何做产品的人都该看一眼。

智能体 Google 评测/基准