AI and technology watch

AI 新闻

聚合过去 24 小时 AI 与开发者生态动态,并提供来源链接以便深入阅读。

---
AI HOT ·

我们为 Claude Platform 添加了一个 CLI,使每个 API 端点都可以从你的终端运行。 调用 Messages API,启动 Claude 托管智能体,并将结果直接管道传输到你的 shell。 ant CLI 被使用 claude-api 技能的编码智能体(Claude Code)很好地理解。

02:54 ClaudeDevs @ ClaudeDevs 精选 77 Anthropic MCP/工具 产品更新 部署/工程 推荐理由: Ant CLI 把 Claude Platform 的所有 API 端点都弄进了终端,配合 Claude Code 用很顺手,做 Agent 或脚本开发的可以直接上手玩。

Anthropic MCP/工具 产品更新 部署/工程
AI HOT ·

微软发布开源框架 Adaptive Spec-driven Scoring:支持用文本描述创建 AI 评估测试

03:08 TechCrunch:AI(RSS) 精选 74 微软开源发布 Adaptive Spec-driven Scoring for Evaluation and Regression Testing 框架。开发者可通过文本描述快速生成 AI 行为测试,用于模型评估与回归测试。 Microsoft 开源/仓库 评测/基准 部署/工程 推荐理由: 微软这个开源框架让 AI 行为测试从写代码降格到写文字描述,做 agent 和 AI 应用的团队可以立刻用它来提升测试效率。

Microsoft 开源/仓库 评测/基准 部署/工程
AI HOT ·

"你现在可以在公司内部运行 OpenClaw 了。" 宣布我们与 @Microsoft 的合作,将 OpenClaw 带入微软和 Windows 生态系统。Claws 现在可以在企业环境中安全运行。

02:04 OpenClaw🦞 @ openclaw 精选 69 智能体 Microsoft 产品更新 部署/工程 关联讨论 1 条 The Verge:AI(RSS) 推荐理由: OpenClaw 和微软的合作,让企业终于能在自家 Windows 环境里跑这个 AI Agent,对看重合规与安全的团队来说,这比功能更新更实在。

智能体 Microsoft 产品更新 部署/工程
AI HOT ·

微软首款高级推理AI模型MAI-Thinking-1发布

02:45 The Verge:AI(RSS) 精选 78 微软在Build 2026上发布了其首款高级推理AI模型MAI-Thinking-1。该模型被定位为“中等规模”,能在“关键”软件工程基准测试中达到领先模型的水平。微软称其完全从头使用干净数据进行训练,未涉及从第三方模型进行知识蒸馏。这标志着微软在自研AI模型上迈出重要一步,此前其主要依赖OpenAI。近期两家公司已重新协商合作协议,关系有所松绑。 Microsoft 推理 模型发布 关联讨论 3 条 X:Satya Nadella (@satyanadella) X:Rohan Paul (@rohanpaul_ai) Hacker News 热门(buzzing.cc 中文翻译) 推荐理由: 微软自己从头训练的推理模型,不用任何第三方蒸馏数据,这可能是微软系 Agent 和 Copilot 底座更换的信号,值得盯着看。

Microsoft 推理 模型发布
AI HOT ·

GitHub Copilot应用:智能体原生的桌面体验

01:56 GitHub Blog 精选 72 在微软 Build 2026 大会上,GitHub 发布了新的工具和更新,并将 Copilot 应用定位为“智能体原生的桌面体验”。其核心目标是让 AI 智能体能够以用户已经习惯的方式进行工作。 智能体 GitHub 产品更新 编码 关联讨论 1 条 The Verge:AI(RSS) 推荐理由: GitHub 把 Copilot 从插件变成了独立桌面应用,Agent 不再躲在 IDE 背后,这是 AI 编程从辅助工具走向桌面中枢的标志,开发者现在可以直接在桌面上跟 AI 协作了。

智能体 GitHub 产品更新 编码
AI HOT ·

自进化Hermes智能体:随使用而改进的企业AI | Nemotron Labs

02:00 NVIDIA AI @ NVIDIAAI 精选 62 智能体 产品更新 推荐理由: NVIDIA第一次认真做企业AI代理,'越用越聪明'这个说法多半是RLHF的包装,但官方下场意味着企业级Agent有了算力+软件的整合方案,做私有化部署的人可以跟进了。

智能体 产品更新
AI HOT ·

AFUN: 迈向功能理解的可供性基础模型

01:40 HuggingFace Daily Papers(社区热门论文) 精选 71 AFUN是一个用于功能理解的可供性基础模型。它从单个RGB-D观察和语言任务描述出发,能同时预测任务条件的功能掩码(where)和3D接触后运动曲线(how)。为实现开放世界泛化,该研究构建了一个大规模标准化数据管道,整合了机器人、人类、仿真与真实扫描数据。评估结果显示,AFUN在可供性分割任务上,于4个基准的8个测试集中平均gIoU/cIoU指标分别大幅领先基线模型+23.9/+26.3;在接触点预测上,命中率比最佳基线高出12.7%–61.3%;在3D运动预测上也取得最佳性能。该模型无需针对特定机器人实体进行微调即可直接部署。 具身智能 数据/训练 论文/研究 推荐理由: 在 affordance 基础模型方向做出一步,跨 8 个测试集大幅超越基线,并可直接部署到真实机器人,对具身智能的通用化是个值得关注的信号。

具身智能 数据/训练 论文/研究
AI HOT ·

我们相信 AI 可以成为专属研究伙伴,帮助发现下一个突破。 隆重推出 Co-Scientist:我们最新的基于 Gemini 的多智能体系统,能够为复杂科学问题生成、辩论和演进新颖的假设 🧵

01:31 Google DeepMind @ GoogleDeepMind 精选 61 智能体 Google 产品更新 推理 推荐理由: Google DeepMind 把多智能体系统搬到了科学假设生成上,'AI 科研伙伴'的构想不再只是蓝图,虽然落地还远,但思路值得搞科研的人持续关注。

智能体 Google 产品更新 推理
AI HOT ·

教一个智能体一次工作流,让它在每次重建后都记住。 本教程展示如何使用 NVIDIA NemoClaw 和 OpenShell 部署 NousResearch Hermes Agent,将其连接到 Slack、Outlook、GitHub 和 NVIDIA 开发者论坛,然后将聊天纠正转化为可复用的技能。 私有数据保留在运行时策略之后。学到的技能在部署之间持续存在。

01:30 NVIDIA AI @ NVIDIAAI 精选 71 智能体 MCP/工具 教程/实践 推荐理由: NVIDIA 的官方教程,把代理的「一次教会,永不忘记」变成了可落地的步骤,连 Slack、GitHub 都能接,做 agent 的值得照着跑一遍。

智能体 MCP/工具 教程/实践
AI HOT ·

Claude Code团队实践:智能体编程如何重塑工程组织与流程

00:45 Claude:Blog(网页) 精选 74 在Code w/ Claude SF 2026活动上,Claude Code工程团队分享了将智能体编程设为默认工作方式后带来的流程与结构变革。核心变化包括:规划转向即时(JIT)模式,强调快速原型与反馈;上下文收集变为“先问Claude”;代码审查中Claude处理风格与测试,人工专注于法律、安全等专业判断。新范式下,工程瓶颈从编写代码转向验证、审查与安全维护。 Anthropic 大佬观点 现象/趋势 部署/工程 关联讨论 1 条 X:邵猛 (@shao__meng) 推荐理由: Anthropic 工程总监把 Claude Code 团队流程全晒了出来,从抛弃半年路线图到代码审查只留专家复审,每一步都反直觉但实战有效,工程领导者直接抄作业。

Anthropic 大佬观点 现象/趋势 部署/工程
AI HOT ·

开放模型的繁荣生态

00:37 Tomer Tunguz 博客(VC 分析) 精选 61 根据OpenRouter平台数据,自2025年以来,开放模型使用量显著增长。最新数据显示,开放权重模型产生了69.1%的token使用量,闭源模型为30.9%。新模型的发布会吸引开发者测试,推动token使用量达到新的平台期。开放模型市场内部竞争激烈,领导地位频繁更迭,如DeepSeek的早期优势在2025年末至2026年初被MiniMax与Kimi模型取代,随后MiMo、Qwen、腾讯Hy3、阿里巴巴及Arcee等模型的发布再次改变了份额格局。尽管开放模型目前仍只占推理总量的一小部分,但激烈的竞争与增长表明,开发者正越来越愿意将生产流量路由至开放模型。 开源生态 现象/趋势 推荐理由: 开放模型在OpenRouter上的token份额已到69%,而且每轮新模型发布都会把使用量推上一个台阶,做推理基础设施的应该重视这个信号。

开源生态 现象/趋势
AI HOT ·

特朗普签署修订版AI行政命令,要求自愿预发布审查

00:37 TechCrunch:AI(RSS) 精选 75 在业界反对后,特朗普总统签署了修订版AI行政命令,该命令要求对先进模型进行自愿预发布政府审查,而非强制要求。 安全/对齐 政策/监管 行业动态 关联讨论 1 条 The Verge:AI(RSS) 推荐理由: 特朗普签了缩水版 AI 监管行政令,只要求「自愿」审查,给巨头松绑的意味很明显。但对创业公司来说,政策不确定性还在,别高兴太早。

安全/对齐 政策/监管 行业动态
AI HOT ·

构建应用从未如此简单。 通过 Sites,Codex 可以将你的工作、想法和计划转化为一个交互式网站或应用,你的团队可以通过一个 URL 进行探索、使用和分享。 该功能将首先向 Business 和 Enterprise 计划推出,之后会更广泛地扩展。

00:33 OpenAI @ OpenAI 精选 70 OpenAI 产品更新 部署/工程 关联讨论 1 条 X:Rohan Paul (@rohanpaul_ai) 推荐理由: Codex Sites 让应用构建门槛降到「描述即生成」,对企业团队快速验证想法是实打实的效率提升,但只开放 Business/Enterprise 意味着个人开发者还得等等。

OpenAI 产品更新 部署/工程
AI HOT ·

OpenAI Codex 发布 Python SDK,可直接嵌入应用

00:36 向阳乔木 @ vista8 精选 75 这个有点厉害,Codex 出 Python SDK了。 安装指令:pip install openai-codex 整合到自己的代码中,相当于直接内置了顶级编程和生图Agent? 最关键的是,可以复用 Codex 登录态。 Vaibhav (VB) Srivastav : We just released the Codex Python SDK 🔥 You can now embed Codex directly into your Python apps and workflows! > Start t... 智能体 OpenAI 产品更新 编码 推荐理由: Codex不再是独立工具,现在变成了一个可以嵌入任何Python项目的编程Agent。对于那些想构建自动化编程工作流的人来说,这个SDK是个真正的起点。

智能体 OpenAI 产品更新 编码
AI HOT ·

商汤开源SenseNova-Skills AI办公技能套件

23:05 SenseTime @ SenseTime_AI 精选 81 商汤开源了AI办公技能套件SenseNova-Skills。这是一个为任何技能兼容智能体(如OpenClaw与HermesAgent)设计的开源技能集合,提供四大核心功能:图像信息图表生成(可镜像参考风格)、数据分析(支持多表解析、清洗与可视化)、PPT创建(生成大纲内容并智能排版,输出可编辑文件)以及深度研究(跨学术、技术、社交等多源搜索并生成报告)。该技能套件现已完全开源。 智能体 图像生成 开源/仓库 推荐理由: 商汤掏出了一套开箱即用的 agent 技能包,从做图到写报告都能一键接,而且代码全在 GitHub 上。想做 agent 产品的可以直接 fork 当乐高用,比等 API 发布快多了。

智能体 图像生成 开源/仓库
AI HOT ·

为什么金融机构正汇聚在交易基础模型上来构建自身智能

23:57 NVIDIA AI Blog 精选 69 金融机构正从为每个业务线构建独立AI模型,转向采用基于Transformer的交易基础模型,以统一理解消费者行为并克服数据孤岛限制。NVIDIA报告显示,65%的金融机构已使用AI,近90%正在部署或评估。实践案例包括:Revolut与NVIDIA合作构建了PRAGMA模型系列,在240亿事件上训练,单个模型在信用评分等领域超越特定任务模型;Mastercard正开发专有大型表格基础模型;Adyen的模型处理了1万亿美元支付;Stripe利用相关平台构建模型,去年阻止了近1120亿美元欺诈。 智能体 产品更新 数据/训练 关联讨论 2 条 NVIDIA Blog:Agentic AI(网页) NVIDIA Blog:Generative AI(网页) 推荐理由: 金融机构从散装模型走向统一transformer架构,这次连NVIDIA都给出了可跑的开发者示例,Revolut、Mastercard已经在用了,做金融数据的可以直接上手试试。 23:05 SenseTime @ SenseTime_AI 精选 81 商汤开源SenseNova-Skills AI办公技能套件 商汤开源了AI办公技能套件SenseNova-Skills。这是一个为任何技能兼容智能体(如OpenClaw与HermesAgent)设计的开源技能集合,提供四大核心功能:图像信息图表生成(可镜像参考风格)、数据分析(支持多表解析、清洗与可视化)、PPT创建(生成大纲内容并智能排版,输出可编辑文件)以及深度研究(跨学术、技术、社交等多源搜索并生成报告)。该技能套件现已完全开源。 智能体 图像生成 开源/仓库 推荐理由: 商汤掏出了一套开箱即用的 agent 技能包,从做图到写报告都能一键接,而且代码全在 GitHub 上。想做 agent 产品的可以直接 fork 当乐高用,比等 API 发布快多了。 22:58 OpenAI:官网动态(RSS · 排除企业/客户案例) 精选 69 OpenAI呼吁通过全球领导力推进青年AI安全与机遇 OpenAI呼吁通过设立专门的AI安全研究所,在全球范围内采取行动,以保障青少年在使用AI时的安全,并创造更多发展机遇。 OpenAI 安全/对齐 推荐理由: OpenAI正式发声呼吁成立青少年AI安全研究所,这件事的象征意义大于实际动作,但对所有做教育AI的公司是个明确的信号,青少年保护将成监管重点。 22:40 Hugging Face:Blog(RSS) 精选 73 Holo3.1:快速本地计算机使用智能体 Holo3.1 是基于 Qwen 模型家族的计算机使用智能体系列,旨在提升在桌面、网页和移动环境中的鲁棒性。新模型提供 0.8B、4B、9B 和 35B-A3B 四种尺寸,并首次发布量化检查点,包

智能体 产品更新 数据/训练 图像生成 开源/仓库 OpenAI 安全/对齐 Hugging Face 模型发布 开源生态 行业动态 部署/工程 Anthropic Google 评测/基准 arXiv 论文/研究 现象/趋势 端侧 具身智能 推理 GitHub MCP/工具 政策/监管
AI HOT ·

Gary Marcus:为什么事情终将崩塌

00:22 Gary Marcus:The Road to AI We Can Trust(RSS) 精选 58 知名人工智能批评者Gary Marcus在其关于可信赖AI的专栏中,探讨了人工智能发展面临的根本性挑战。文章开篇即指向问题的核心,指出相关数学理论的局限性与人类心理的复杂性,是导致AI系统最终可能出现问题的根源。 大佬观点 安全/对齐 推荐理由: Marcus用数学和心理学双重框架解释AI信任为何必然崩溃,比他以往只说深度学习不可信更完整,但核心还是那套,做安全的人可以看看有没有新论据。

大佬观点 安全/对齐
AI HOT ·

⚡ 新增服务商:DigitalOcean 的 AI-Native Cloud 现已在 OpenRouter 上线。 提供高性能推理,覆盖热门开源权重模型。在 DeepSeek V3.2 的输出速度和延迟方面排名第一(数据来自 @ArtificialAnlys)。 查看其数据并试用模型:https://openrouter.ai/provider/digitalocean

00:29 OpenRouter @ OpenRouter 精选 68 DeepSeek 产品更新 推理 部署/工程 推荐理由: OpenRouter 新上线的 DigitalOcean 推理服务,把 DeepSeek V3.2 的延迟压到了全场最低,比官方还快,做实时应用的值得立刻切过去试一下。

DeepSeek 产品更新 推理 部署/工程
AI HOT ·

MiniCPM-V 4.6 现已完全支持 vLLM v0.22.0! 无需自定义分支,无需额外编译。 只需拉取预构建包即可运行。 非常感谢 @vllm_project 的顺畅集成! 🤝 🤗 http://huggingface.co/openbmb/MiniCPM-V-4.6

22:21 OpenBMB @ OpenBMB 精选 67 产品更新 部署/工程 推荐理由: MiniCPM-V 4.6 现在 vLLM 原生支持,不用自己折腾编译和环境了,做多模态部署的可以无痛接入,国产端侧模型生态又往前走了一步。

产品更新 部署/工程