AI and technology watch

AI 新闻

聚合过去 24 小时 AI 与开发者生态动态,并提供来源链接以便深入阅读。

---
AI HOT ·

DiffusionGemma:文本生成速度提升4倍的开源扩散模型

今日热点 TOP 5 1 9 信源 · 1天前 2 Claude Fable 5 和 Claude Mythos 5 6 信源 · 4小时前 3 OpenAI 正酝酿“大幅”降价,Gary Marcus 视其为示弱信号 4 信源 · 18小时前 4 小米发布并开源终端AI编程助手MiMo Code V0.1.0,采用MIT协议 6 信源 · 23小时前 5 Prometheus 融资120亿美元,估值410亿美元,定位“人工通用工程师” 4 信源 · 14小时前

AI HOT ·

什么是 LLM 网关?应用与 AI 模型之间缺失的一层

05:05 OpenRouter:Announcements(RSS) 精选 60 缺少 LLM 网关时,供应商中断会直接变成用户可见的错误,AI 支出也难以追踪。文章从路由、合规性和设置时间三个维度比较了最佳方案。 教程/实践 部署/工程 推荐理由: LLM 网关正在成为 AI 栈的必备层,这篇把路由、合规、部署时间这些选型维度拆得明白,正在做生产级集成的团队值得点开对照自己的架构。

教程/实践 部署/工程
AI HOT ·

全自主无人机首次击毙了人类士兵

03:47 Hacker News 热门(buzzing.cc 中文翻译) 精选 88 据《新科学家》6月10日报道,全自主无人机首次击毙了人类士兵。这是有记录以来第一次由完全自主运行的无人机执行致命攻击,标志着自主武器系统在实战中的新进展。该报道来自《新科学家》网站,目前尚无更多细节公布。 具身智能 安全/对齐 政策/监管 推荐理由: 全自主无人机首次实战杀人,这不再是实验室里的讨论,而是战场上的人命。自主武器的伦理和法律真空被推到台前,各国政策制定者该连夜开会了。

具身智能 安全/对齐 政策/监管
AI HOT ·

AI 智能体很强大,但它们不记得你的偏好。 所以你总是重复指令--如何组织项目、你的品牌指南。 现在你可以通过自定义指令和技能让 Replit Agent 学会你的惯例。 它会在每个项目中自动将这些考虑进去。

03:12 Replit ⠕ @ Replit 精选 65 智能体 产品更新 编码 推荐理由: Replit Agent 终于学会记住你的偏好了,自定义指令能让它更像一个了解你工作习惯的同事,不用每次重复项目结构、品牌规范,做 side project 的效率会明显提升。

智能体 产品更新 编码
AI HOT ·

Anthropic与DXC达成全球联盟,将Claude引入关键行业系统

02:13 Anthropic:Newsroom(网页) 精选 74 Anthropic与IT服务公司DXC Technology达成多年全球联盟。DXC将培训数万名获得Claude认证的前沿部署工程师(FDE),将Claude引入其为全球大型银行、航空公司、保险公司及政府机构运营的关键系统。内部部署中,Claude已成为DXC OASIS平台的默认基础模型,该平台超95%代码由Claude编写,开发速度提升10倍,已服务50多家客户。DXC加入Claude Partner Network,将在保险、现代化服务、网络安全及应用服务四个领域率先推出基于Claude的解决方案。 智能体 Anthropic 行业动态 推荐理由: 这是 Anthropic 在企业服务赛道的一次重大卡位,DXC 把银行、航空等关键行业的系统交给 Claude,比任何 benchmark 都更能证明模型在大规模生产环境中的可靠性。

智能体 Anthropic 行业动态
AI HOT ·

MaxProof:面向数学证明的群体级别测试时扩展框架(MiniMax-M3)

11:00 HuggingFace Daily Papers(社区热门论文) 精选 79 MaxProof 是为 MiniMax-M3 系列设计的群体级别测试时扩展框架,用于竞赛级数学证明。M3 模型训练了证明生成、证明验证和基于 critique 的证明修复三种能力,验证器采用低假阳性率的深度防御生成式架构。这些能力合并到单个 M3 模型。测试时,MaxProof 将模型用作生成器、验证器、精炼器和排序器,在候选证明群体中搜索并通过锦标赛选择返回最终证明。M3 模型在 IMO 2025 达 35/42,USAMO 2026 达 36/42,均超过人类金牌阈值。 推理 论文/研究 推荐理由: MiniMax-M3用生成-验证器RL把数学证明推到了人类金牌水平,IMO 2025 35/42,USAMO 2026 36/42。这篇的意义不只分数,而在于验证-修复-群体搜索的技术路线跑通了最难的人类竞赛。 11:00 HuggingFace Daily Papers(社区热门论文) 精选 70 EurekAgent:环境工程化实现自主科学发现 EurekAgent 是一个环境工程化的大语言模型智能体系统,专为度量驱动的自主科学发现设计。它从权限工程(可控执行与隔离评估)、产物工程(文件系统与 Git 协作)、预算工程(成本感知探索)和人在回路工程(简便监督干预)四个维度构建执行环境。EurekAgent 在数学、内核工程和机器学习任务上取得新 SOTA,包括以不到 11 美元总 API 成本发现新的 26 圆填充结果。代码与结果已开源。 智能体 arXiv 开源生态 论文/研究 推荐理由: EurekAgent 把科学发现的目光从设计智能体流程转向环境工程,用不到 11 美元就找到了新的圆打包纪录,这可能是低成本自主科研的转折点。 11:00 HuggingFace Daily Papers(社区热门论文) 精选 75 WEAVER:一种更优、更快、更长的机器人操作世界模型 WEAVER是一种多视图世界模型架构,通过流匹配损失训练预测未来潜变量和奖励值,满足保真度、一致性和效率三个要求。在机器人操作任务上,WEAVER在政策评估中与真实成功率的相关系数ρ=0.870,在π₀.₅基础模型基础上实现政策改进成功率提升38%,测试时规划成功率提升14%,且速度比先前世界模型快5–10倍。在分布外场景下表现也优于先前世界模型。代码、模型和视频已开源。 arXiv 具身智能 数据/训练 论文/研究 推荐理由: 世界模型在机器人操控上第一次同时跑通了「高保真、长时一致、高推理效率」这三个硬指标,真机实验把成功率拉高38%,代码模型全开源,搞具身智能的值得认真读。 11:00 向阳乔木 @ vista8 精选 75 qiaomu-ai-prd:面向AI的PRD生成Prompt

推理 论文/研究 智能体 arXiv 开源生态 具身智能 数据/训练 MCP/工具 教程/实践 产品更新 多模态 端侧 GitHub 编码 OpenAI 安全/对齐 部署/工程 政策/监管 Anthropic 行业动态 搜索 Google 图像生成 模型发布 DeepSeek 开源/仓库 xAI
AI HOT ·

DeepSeek-R1 的开源实现

01:17 Hacker News 热门(buzzing.cc 中文翻译) 精选 71 DeepSeek-R1 的开源复现项目已在 GitHub 发布,在 Hacker News 上获得 101 个积分。该项目旨在以开源方式复现 DeepSeek-R1 模型。 DeepSeek 开源/仓库 推理 推荐理由: Hugging Face 开源复现 DeepSeek-R1,这是推理模型透明化的关键一步,训练代码和权重都放出来了,搞强化学习和推理优化的可以直接开工。

DeepSeek 开源/仓库 推理
AI HOT ·

Gemini Omni Flash 在图像到视频、文本到视频和视频编辑方面达到了 SATA : ) 很高兴很快能将这一能力通过 API 提供给开发者!

01:20 Logan Kilpatrick @ OfficialLoganK 精选 81 Google 图像生成 多模态 模型发布 推荐理由: 视频生成正式进入全模态一体时代,Gemini Omni Flash 把图生视频、文生视频和剪辑整合在一个模型里,API 很快上线,做视频工具的可以提前琢磨对手在哪了。

Google 图像生成 多模态 模型发布
AI HOT ·

Cursor 推出 Auto-review 机制:用分类器智能体动态管控智能体自主权限

01:24 Cursor Blog 精选 74 Cursor 近日推出 Auto-review,通过一个专门的分类器智能体在工具调用前审查动作风险。该分类器根据上下文判断动作是否与用户意图一致,高风险时阻止并返回解释给父智能体,低风险时放行。分类器采用小模型,运行在智能体循环内以避免额外延迟,并能读取工作区文件辅助判断。测试基于约12小时内部开发会话生成的6122条标签数据,以及针对读取密钥、操作生产数据等危险场景的合成数据。设计目标是在不频繁阻断日常开发的前提下,拦截风险动作。 智能体 产品更新 安全/对齐 关联讨论 1 条 Cursor Blog 推荐理由: Cursor把agent监管从"是/否"开关变成了可调节的刻度盘,一个专用小模型实时判断操作风险,高风险时给反馈让父agent换个安全方案,而非频繁打断用户。用Cursor的开发者都得了解这个逻辑。

智能体 产品更新 安全/对齐
AI HOT ·

BBVA 将 AI 置于银行业务核心,与 OpenAI 合作

01:39 OpenAI:官网动态(RSS · 排除企业/客户案例) 精选 60 BBVA 将 ChatGPT Enterprise 推广至 10 万名员工,并与 OpenAI 达成合作,加速全球银行业 AI 驱动的转型。 OpenAI 行业动态 部署/工程 推荐理由: BBVA给10万员工部署ChatGPT Enterprise,是金融业最大规模之一,但本质是PR案例,信息量有限,想参考银行级AI落地的可以扫一眼。

OpenAI 行业动态 部署/工程
AI HOT ·

我们正在将 Deep Research 作为原生技能集成到 Computer 中。 它现在连接到驱动 Computer 的智能体框架,可访问搜索即代码生成、长运行沙箱、连接器、工具和授权数据。 Pro 和 Max 订阅者现已可用。

01:54 Perplexity @ perplexity_ai 精选 77 智能体 产品更新 搜索 推荐理由: Perplexity 把深度研究直接嵌进 Computer 的 agent 层,等于给自主代理加了个研究引擎,Pro 用户现在就能用,对需要大量调研的开发者或产品人来说是个效率飞轮。

智能体 产品更新 搜索
AI HOT ·

xAI 推出 Grok Build Plugin Marketplace

00:13 xAI:News(网页) 精选 70 xAI 今日发布 Grok Build 内置插件市场。插件将技能、斜杠命令、AI 智能体、钩子、MCP 服务器和 LSP 打包为可安装包,用户无需离开终端即可浏览、安装和更新。首发合作伙伴包括 MongoDB、Vercel、Sentry、Chrome DevTools、Cloudflare 和 Superpowers。在 Grok Build 中输入 `/marketplace` 或使用 CLI 即可安装,每个远程插件均固定到特定 commit SHA 并经过验证。开发者可提交 PR 到 xai-org/plugin-marketplace 发布自己的插件。 MCP/工具 xAI 产品更新 编码 关联讨论 1 条 X:xAI (@xai) 推荐理由: Grok Build 这下可以像浏览器装扩展一样装插件了,涵盖数据库、部署、调试,开发者不必离开终端,这类集成对 AI 编程环境的体验影响挺大的。

MCP/工具 xAI 产品更新 编码
AI HOT ·

OpenAI 将收购 Ona

00:39 OpenAI:官网动态(RSS · 排除企业/客户案例) 精选 60 OpenAI 计划收购 Ona,以拓展 Codex 的功能,提供安全、持久的云端环境,从而支持企业工作流中长时间运行的 AI 智能体。 智能体 OpenAI 行业动态 部署/工程 推荐理由: OpenAI 收购 Ona,补齐了 Codex 从单次对话到跑几天几夜长任务的最后一公里,做企业 agent 的可以盯一下后续整合。

智能体 OpenAI 行业动态 部署/工程
AI HOT ·

Codex Goal指令生成Skill发布:一句话需求转目标

23:27 向阳乔木 @ vista8 精选 75 针对如何给Codex写Goal指令的问题,作者发布了一个Skill,可将一句话需求自动转化为目标,实现“睡前写指令、模型自动开发、第二天收菜”。安装命令:`npx skills add joeseesun/qiaomu-goal-meta-skill`。源码免费开源(见评论区),旨在简化4w字文档的阅读负担。 智能体 OpenAI 教程/实践 编码 推荐理由: 如果你也用Codex写代码但老写不好Goal,乔木这个Skill能直接把一句话需求转成高标准指令,安装即用,今晚就能试试睡觉“收菜”的体验。

智能体 OpenAI 教程/实践 编码
AI HOT ·

使用我们的基准探索器,为10个不同基准绘制帕累托曲线。 更多功能即将推出!https://openrouter.ai/rankings#benchmarks

23:46 OpenRouter @ OpenRouter 精选 77 产品更新 评测/基准 关联讨论 1 条 X:OpenRouter (@OpenRouter) 推荐理由: 老是纠结选哪个模型又便宜又好用?OpenRouter 这个基准浏览器把性能和价格画成帕累托曲线,一眼看出性价比之王,选型党必备。

产品更新 评测/基准
AI HOT ·

Grok Build 插件市场现已进入公测阶段。你可以在终端中使用 MongoDB、Vercel、Sentry、Cloudflare 和 Chrome DevTools 等插件进行开发。详情:https://x.ai/news/grok-plugin-marketplace

04:52 xAI @ xai 精选 73 xAI : The Grok Build Plugin Marketplace is now in beta. Build with MongoDB, Vercel, Sentry, Cloudflare, and Chrome DevTools pl... 智能体 MCP/工具 xAI 产品更新 推荐理由: Grok 的 Plugin Marketplace 把开发工具链直接塞进终端,从 Sentry 到 Chrome DevTools,让 agent 自己能查错修 bug,开发者值得第一时间上手试试它的自动化程度。 03:47 Hacker News 热门(buzzing.cc 中文翻译) 精选 88 全自主无人机首次击毙了人类士兵 据《新科学家》6月10日报道,全自主无人机首次击毙了人类士兵。这是有记录以来第一次由完全自主运行的无人机执行致命攻击,标志着自主武器系统在实战中的新进展。该报道来自《新科学家》网站,目前尚无更多细节公布。 具身智能 安全/对齐 政策/监管 推荐理由: 全自主无人机首次实战杀人,这不再是实验室里的讨论,而是战场上的人命。自主武器的伦理和法律真空被推到台前,各国政策制定者该连夜开会了。 03:12 Replit ⠕ @ Replit 精选 65 AI 智能体很强大,但它们不记得你的偏好。 所以你总是重复指令--如何组织项目、你的品牌指南。 现在你可以通过自定义指令和技能让 Replit Agent 学会你的惯例。 它会在每个项目中自动将这些考虑进去。 智能体 产品更新 编码 推荐理由: Replit Agent 终于学会记住你的偏好了,自定义指令能让它更像一个了解你工作习惯的同事,不用每次重复项目结构、品牌规范,做 side project 的效率会明显提升。 02:13 Anthropic:Newsroom(网页) 精选 74 Anthropic与DXC达成全球联盟,将Claude引入关键行业系统 Anthropic与IT服务公司DXC Technology达成多年全球联盟。DXC将培训数万名获得Claude认证的前沿部署工程师(FDE),将Claude引入其为全球大型银行、航空公司、保险公司及政府机构运营的关键系统。内部部署中,Claude已成为DXC OASIS平台的默认基础模型,该平台超95%代码由Claude编写,开发速度提升10倍,已服务50多家客户。DXC加入Claude Partner Network,将在保险、现代化服务、网络安全及应用服务四个领域率先推出基于Claude的解决方案。 智能体 Anthropic 行业动态 推荐理由: 这是 Anthropic 在企业服务赛道的一次重大卡位,DXC 把银行、航空等关键行业的系统交给 Claude,比任何 benchma

智能体 MCP/工具 xAI 产品更新 具身智能 安全/对齐 政策/监管 编码 Anthropic 行业动态 搜索 OpenAI 部署/工程 Google 图像生成 多模态 模型发布 DeepSeek 开源/仓库 推理