AI and technology watch

AI 新闻

聚合过去 24 小时 AI 与开发者生态动态,并提供来源链接以便深入阅读。

---
AI HOT ·

GLM-5.2 上线并开源:专注 Coding 与长程任务

今日热点 TOP 5 1 8 信源 · 1小时前 2 SpaceX正式以600亿美元收购Cursor 9 信源 · 16小时前 3 Qwen-Robot Suite:面向物理世界智能的基础模型套件 5 信源 · 11小时前 4 OpenAI 的领先优势正在快速缩小 4 信源 · 11小时前 5 SpaceX 全股票收购 Cursor 5 信源 · 12小时前

AI HOT ·

GLM-5.2上线并开源:专注Coding与长程任务

09:20 公众号:智谱(GLM) 精选 81 智谱今日发布并开源GLM-5.2,在前端开发盲测系统Code Arena上取得全球可用模型第一。该模型专为长程任务设计,实现1M无损上下文,支持跨越数天的任务执行。在FrontierSWE上仅比Claude Opus 4.8低1%,超过GPT-5.5(1%)和Opus 4.7(11%);Terminal-Bench 2.1上比Opus 4.8低4%,较GLM-5.1提升17.5%。引入思考档位控制,Coding能力介于Opus 4.7与4.8之间。提出IndexShare架构降低单位FLOPs至2.9倍,改进MTP层提升接受长度20%。已在华为昇腾等国产算力平台适配。模型权重以MIT协议开源,API已上线并纳入GLM Coding Plan。 智能体 Hugging Face 模型发布 编码 关联讨论 6 条 X:Testing Catalog (@testingcatalog) X:歸藏 (@op7418) X:智谱 Z.ai (@Zai_org) IT之家(RSS) X:Oran Ge (@oran_ge) X:Kim (@kimmonismus) 推荐理由: 智谱把开源Coding模型拉到接近Claude Opus 4.8的位置,1M上下文稳定支撑数周级长程任务,MIT开源意味国产替代有了真正能打的选择。

智能体 Hugging Face 模型发布 编码
AI HOT ·

GLM-5.2上线并开源:专注Coding与长程任务

今日热点 TOP 5 1 7 信源 · 7分钟前 2 SpaceX正式以600亿美元收购Cursor 9 信源 · 14小时前 3 Qwen-Robot Suite:面向物理世界智能的基础模型套件 5 信源 · 8小时前 4 OpenAI 的领先优势正在快速缩小 4 信源 · 9小时前 5 SpaceX 全股票收购 Cursor 5 信源 · 10小时前

AI HOT ·

Fable 遭美国政府封禁,TechCrunch 质疑真正原因并非模型越狱

00:53 Hacker News 热门(buzzing.cc 中文翻译) 精选 75 美国政府对 Anthropic 的模型 Fable 实施封禁,但 TechCrunch 发文质疑,实际原因可能并非此前认为的“模型越狱”问题。该文章在 Hacker News 引发讨论,获得 103 个点赞。 Anthropic 安全/对齐 政策/监管 推荐理由: 政府一纸令下就逼停 Anthropic 两大模型,这个先例比一次所谓的越狱争议严重得多,它直接挑战了 AI 公司独立运营的基本前提,所有做前沿模型的人都该警觉。

Anthropic 安全/对齐 政策/监管
AI HOT ·

OpenRouter Presets:当模型下线时保持 AI 智能体运行

02:03 OpenRouter:Announcements(RSS) 精选 62 Anthropic 在 Claude Fable 5 发布仅数天后便对其进行了限制。如果代码硬编码模型 slug,该限制也会导致服务中断。OpenRouter 的 Presets 功能将模型选择移至服务器端,使用户无需重新部署即可切换模型、设置回退策略并强制执行数据策略。 智能体 教程/实践 部署/工程 推荐理由: 给 Agent 开发者的实用提醒,硬编码模型名会在供应商限制时塌方,用 Presets 换模型、设降级方案比现改代码省心。

智能体 教程/实践 部署/工程
AI HOT ·

微软考虑为 Copilot Cowork 集成 DeepSeek V4

02:24 Chubby♨️ @ kimmonismus 精选 75 微软正考虑为 Copilot Cowork 提供微软托管的 DeepSeek V4 版本,作为更便宜的模型选项。Copilot Cowork 将放弃无限定价,转向按使用量计费,原因是成本过高(用户每周执行数百项任务导致费用激增)。若采用 DeepSeek,该模型将是可选的、经过微调与安全防护,并完全托管于 Azure。Axios 报道称微软已微调了一个可用模型,最终决定待定。 Ina Fried : New @axios: Microsoft eyes DeepSeek for Copilot Cowork as it also joins the shift to usage based pricing. Says final dec... DeepSeek Microsoft 开源生态 行业动态 推荐理由: 微软考虑在 Copilot Cowork 中引入 DeepSeek V4 作为便宜选项,同时转向按用量计价。如果落地,这不仅是成本策略的转向,更可能打破企业 AI 对开源模型的信任壁垒,定价变革也会给全行业施加压力。

DeepSeek Microsoft 开源生态 行业动态
AI HOT ·

Meta 解散工程部门引发热议

02:53 Hacker News 热门(buzzing.cc 中文翻译) 精选 80 6月16日,一篇标题为“Why is Meta destroying its engineering organization?”的博客文章出现在 Hacker News,获得110个点赞。文章指出 Meta 正在解散其工程组织,引发业界广泛讨论。具体原因和后续影响尚未明确。 Meta 安全/对齐 现象/趋势 编码 推荐理由: Meta 这波操作是 AI 狂热下自毁工程文化的教科书级案例,从强制数据标注到指标驱动的 token 最大化,最终导致 Instagram 的安全灾难,虽然后来撤销部分裁员,但信任已崩。

Meta 安全/对齐 现象/趋势 编码
AI HOT ·

Grok for PowerPoint 发布:在 Microsoft PowerPoint 内直接生成和编辑幻灯片

00:23 xAI:News(网页) 精选 64 xAI 于 6 月 16 日发布 Grok for PowerPoint,作为免费 Microsoft 365 插件上线。用户无需离开应用即可利用 Grok 将大纲转为完整幻灯片,进行内容研究、撰写、排版,并支持添加单张幻灯片、调整样式主题、重构章节。插件还能调用 Grok 连接器,从邮件或 SharePoint 中获取信息。该插件同样适用于 Word 和 Excel。 Microsoft 产品更新 关联讨论 1 条 X:cb_doge (@cb_doge) 推荐理由: Grok 进入 PowerPoint,让 Grok 用户可以在幻灯片里直接用,但功能跟微软 Copilot 高度重叠,属于跟进式覆盖,没带来新能力,不算重要。

Microsoft 产品更新
AI HOT ·

Copilot Cowork 现已全球正式可用,并支持多模型! 每个组织都可以让长期运行的智能体处理复杂的多步骤任务,基于你组织的独特知识和专有技术。 https://www.microsoft.com/en-us/microsoft-365/blog/2026/06/16/copilot-cowork-is-now-generally-available/?v=15

00:22 Satya Nadella @ satyanadella 精选 70 智能体 Microsoft 产品更新 推荐理由: Copilot Cowork 的正式上线让多模型代理真正进入企业工作流,不再只是演示,团队今天就可以开始部署长期运行的复杂任务代理。

智能体 Microsoft 产品更新
AI HOT ·

小米 MiMo Claw 正式版发布:旗舰模型+金山办公,全新订阅服务上线

22:30 公众号:小米 MiMo 精选 69 小米推出云端轻量化 Claw 类产品 MiMo Claw 正式版,搭载与 OpenClaw 框架深度适配的 MiMo-V2.5-Pro 旗舰模型。该模型原生兼容 MCP 工具调用协议,内置百万级超长上下文,支持单会话千次以上连续工具调用;依托 MTP 三层解码架构,在 OpenClaw 标准 Agent 工作流中吞吐效率提升约 3 倍。ClawEval 测试中任务达标率(Pass³)达 63.8%,Token 消耗较同类产品降低 40%-60%。联动金山办公生态,提供 Word、Excel、PPT、PDF 等格式的 AI 生成、预览与在线编辑一站式服务。免费用户每日单次体验时长从1小时升级至4小时,面向高频用户推出 TokenPlan 分层订阅(Lite/Standard/Pro/Max),支持灵活叠加,限时定价14.9元/月、19.9元/月、233.8元/年。 智能体 MCP/工具 产品更新 关联讨论 2 条 IT之家(RSS) X:小米 MiMo (@XiaomiMiMo) 推荐理由: 小米给普通人用的 Agent 工具正式上线,14.9 元月费很激进,但核心还是看实际任务完成率和办公集成靠不靠谱。 22:16 Elon Musk @ elonmusk 精选 70 AI 将实现 Stockfish 级别的编码和通用计算机使用 SpaceX : SpaceX has exercised the option to acquire @cursor_ai in an all-stock transaction with the goal of building the world's ... xAI 编码 行业动态 关联讨论 4 条 X:小互 (@xiaohu) X:歸藏 (@op7418) X:宝玉 (@dotey) X:Emad Mostaque (@EMostaque) 推荐理由: SpaceX 全资收购 Cursor,同时 xAI 与 Cursor 联合训练的模型即将发布,Musk 放话要做出 Stockfish 级别的编码能力。不管最终是否兑现,AI 编程工具的格局都要变一变了。 21:30 公众号:数字生命卡兹克 精选 67 WorkBuddy日活飙升至行业第二的3-4倍,非技术用户涌入 从3月至今,WorkBuddy日活用户数已达行业第二名的3-4倍,用户不再限于开发者,大量HR、运营、行政等非技术岗位也在使用。其企业版和项目功能进一步扩展了Agent办公场景。同期,Trae Work、QoderWork、Kimi Work等产品纷纷改名或出新,争夺市场。腾讯云认为这可能是十年一遇的机遇。 智能体 现象/趋势 推荐理由: 卡兹克从现场带回WorkBuddy的用户数据,非技术人群用Agent干活不再

智能体 MCP/工具 产品更新 xAI 编码 行业动态 现象/趋势 DeepSeek 开源生态 Google 模型发布 语音 部署/工程 评测/基准 具身智能 数据/训练 多模态 GitHub Microsoft 视频 其他 arXiv Hugging Face Anthropic OpenAI 安全/对齐 大佬观点 教程/实践 Meta 图像生成 搜索 推理
AI HOT ·

AI 将实现 Stockfish 级别的编码和通用计算机使用

22:16 Elon Musk @ elonmusk 精选 70 SpaceX : SpaceX has exercised the option to acquire @cursor_ai in an all-stock transaction with the goal of building the world's ... xAI 编码 行业动态 关联讨论 4 条 X:小互 (@xiaohu) X:歸藏 (@op7418) X:宝玉 (@dotey) X:Emad Mostaque (@EMostaque) 推荐理由: SpaceX 全资收购 Cursor,同时 xAI 与 Cursor 联合训练的模型即将发布,Musk 放话要做出 Stockfish 级别的编码能力。不管最终是否兑现,AI 编程工具的格局都要变一变了。

xAI 编码 行业动态
AI HOT ·

2025年OpenAI亏损额激增近8倍,支出高达340亿美元

21:17 Hacker News 热门(buzzing.cc 中文翻译) 精选 78 据Hacker News热门文章,OpenAI在2025年亏损额激增近8倍,年度总支出达到340亿美元。原文来自wheresyoured.at的独家财务分析报道,该信息在Hacker News上获得超过100个点赞。 OpenAI 行业动态 关联讨论 2 条 Ars Technica:AI(RSS) The Decoder:AI News(RSS) 推荐理由: 独家披露的 OpenAI 财务数据把 AI 行业的烧钱真相摆上了台面,亏损一年涨 8 倍意味着商业化压力已到临界点,这比任何技术参数都更能定义下一阶段的行业走向。

OpenAI 行业动态
AI HOT ·

美国司法部援引国家安全为xAI未经许可的燃气轮机辩护

21:30 The Decoder:AI News(RSS) 精选 80 美国司法部在一份驳回诉讼的动议中称,xAI的聊天机器人Grok对军事行动至关重要,以此为其在密西西比州Southaven的Colossus 2设施运行未经许可的燃气轮机辩护。NAACP已提起诉讼,指控xAI的燃气轮机数量从4月的27台增至57台,导致氮氧化物排放飙升111%。国防部首席数字与人工智能官Cameron Stanley表示,Grok是支持机密和绝密网络军事任务的四款AI模型之一,包括近期针对伊朗的打击。 xAI 行业动态 推荐理由: 司法部用国家安全为 xAI 的环境违规辩护,还首次承认 Grok 支援了对伊朗军事行动,AI 成为战争工具再无遮掩。

xAI 行业动态
AI HOT ·

WorkBuddy日活飙升至行业第二的3-4倍,非技术用户涌入

21:30 公众号:数字生命卡兹克 精选 67 从3月至今,WorkBuddy日活用户数已达行业第二名的3-4倍,用户不再限于开发者,大量HR、运营、行政等非技术岗位也在使用。其企业版和项目功能进一步扩展了Agent办公场景。同期,Trae Work、QoderWork、Kimi Work等产品纷纷改名或出新,争夺市场。腾讯云认为这可能是十年一遇的机遇。 智能体 现象/趋势 推荐理由: 卡兹克从现场带回WorkBuddy的用户数据,非技术人群用Agent干活不再是口号,传统办公软件的危机比想象中来得更快。

智能体 现象/趋势
AI HOT ·

Grok 现在可在 Microsoft PowerPoint 中使用。 我仅用一行文本就创建了整份演示文稿。Grok 在几分钟内为我构建了完整的幻灯片。 绝对令人惊叹。

05:57 DogeDesigner @ cb_doge 精选 80 Microsoft xAI 产品更新 推荐理由: Grok集成进PowerPoint是xAI在办公场景落地的第一次大考,也是普通用户最容易上手Grok的方式,视频里的生成速度确实惊人。 03:52 OpenAI:Alignment 研究博客(RSS) 精选 73 公开聊天数据能否预测真实世界AI失调? OpenAI利用WildChat公开数据集(2023年4月至2024年5月收集的100万条对话)模拟模型部署,预测GPT-5.1、GPT-5.2、GPT-5.4在真实生产环境中的不良行为率。与私有生产数据对比发现,WildChat模拟的平均预测误差约3倍;但对技术性和智能体型失调的预测精度下降。研究验证了公开数据集作为外部审计工具的可行性。 OpenAI 安全/对齐 论文/研究 推荐理由: 用公开旧聊天数据预测模型真实失败率,误差居然在 3 倍以内,做外部审计的可以认真看看。不过 agentic 场景明显不行,需要新数据集。 03:35 Anthropic:Research(发表成果 · 网页) 精选 76 Anthropic:智能体编码中专业知识回报持续存在 Anthropic 基于约40万次 Claude Code 交互会话(2025年10月至2026年4月)分析发现:人类主导规划决策(做什么),Claude 主导执行决策(怎么做)。领域专业知识越强,模型每次指令完成的工作量越多。各类职业完成任务的成功率与软件工程师平均相近;领域专家成功率更高,但与中级用户差距不大。七个月间调试会话占比下降近一半,使用转向端到端智能体任务(部署运行代码、分析数据、编写非代码文档),典型任务价值平均上升约25%。 智能体 Anthropic 编码 论文/研究 推荐理由: 这份报告用40万次真实会话数据揭示了一个反直觉发现,决定Agent编码成败的,不是会不会写代码,而是对自己领域问题的理解深度。对非技术背景用AI编程的人和产品经理都是重要信号。 03:25 OpenAI:官网动态(RSS · 排除企业/客户案例) 精选 74 OpenAI 发布 Deployment Simulation 方法:通过模拟部署预测模型发布前行为 OpenAI 近日发布 Deployment Simulation 方法,通过在隐私保护下重放历史对话、用新候选模型重新生成回复,模拟模型上线后的实际表现。在多个 GPT‑5‑series Thinking 部署中,该方法比传统评估更准确地估计了不良行为频率,发现新型对齐问题,并降低模型识别测试的风险。它还能扩展至涉及工具使用的智能体场景。传统评估存在覆盖不足、选择偏差和模型可识别测试等局限,而 Deployment Simulation 使用真实对话分布缓解了这些问题,但无法测量

Microsoft xAI 产品更新 OpenAI 安全/对齐 论文/研究 智能体 Anthropic 编码 Meta 现象/趋势 DeepSeek 开源生态 行业动态 教程/实践 部署/工程 政策/监管
AI HOT ·

SpaceX 以 600 亿美元股票收购 AI 编程公司 Cursor

19:47 TechCrunch:AI(RSS) 精选 74 SpaceX 在历史性 IPO 数天后,同意以 600 亿美元股票收购 AI 编程初创公司 Cursor,旨在帮助其围绕 xAI 构建的 AI 部门追赶主要 AI 实验室。此前 Cursor 正接近完成一轮 20 亿美元融资,估值 500 亿美元,投资方包括 Andreessen Horowitz、Thrive 和 Nvidia。SpaceX 在 IPO 期间向投资者表示,其 AI 产品可寻址市场达 26 万亿美元。交易预计于今年第三季度完成。 编码 行业动态 关联讨论 8 条 The Verge:AI(RSS) IT之家(RSS) X:Testing Catalog (@testingcatalog) Hacker News 热门(buzzing.cc 中文翻译) X:阿易 AI Notes (@AYi_AInotes) X:Michael Truell (@mntruell) The Decoder:AI News(RSS) Ars Technica:AI(RSS) 推荐理由: SpaceX 收购 Cursor 不只是天价交易,更是马斯克 AI 版图拼上关键一块,对 AI 编程工具市场格局冲击不小。

编码 行业动态
AI HOT ·

美商务部要求Anthropic禁止出口Fable 5和Mythos 5

04:24 Chubby♨️ @ kimmonismus 精选 93 美国商务部长Howard Lutnick告知Anthropic,出口其最新模型Fable 5和Mythos 5至全球任何地方均需政府许可,甚至禁止向任何国籍的海外人士提供。Lutnick在信件中威胁,若不遵守将面临刑事和民事处罚。Anthropic回应:禁用这两个模型。推文作者指出,连友好国家也被排除在SOTA模型之外,AI正从私人公司转向政府控制。该信件全文由Bloomberg公开。 Bloomberg : Read the full text of the letter from US Commerce Secretary Howard Lutnick to Anthropic CEO Dario Amodei. https://www.bl... Anthropic 政策/监管 行业动态 推荐理由: 美国政府首次对具体AI模型实施出口管制,Anthropic被迫禁用Fable 5和Mythos 5,SOTA模型成了战略武器。做国际业务的团队必须马上看一遍合规风险。 03:52 OpenAI:Alignment 研究博客(RSS) 精选 73 公开聊天数据能否预测真实世界AI失调? OpenAI利用WildChat公开数据集(2023年4月至2024年5月收集的100万条对话)模拟模型部署,预测GPT-5.1、GPT-5.2、GPT-5.4在真实生产环境中的不良行为率。与私有生产数据对比发现,WildChat模拟的平均预测误差约3倍;但对技术性和智能体型失调的预测精度下降。研究验证了公开数据集作为外部审计工具的可行性。 OpenAI 安全/对齐 论文/研究 推荐理由: 用公开旧聊天数据预测模型真实失败率,误差居然在 3 倍以内,做外部审计的可以认真看看。不过 agentic 场景明显不行,需要新数据集。 03:35 Anthropic:Research(发表成果 · 网页) 精选 76 Anthropic:智能体编码中专业知识回报持续存在 Anthropic 基于约40万次 Claude Code 交互会话(2025年10月至2026年4月)分析发现:人类主导规划决策(做什么),Claude 主导执行决策(怎么做)。领域专业知识越强,模型每次指令完成的工作量越多。各类职业完成任务的成功率与软件工程师平均相近;领域专家成功率更高,但与中级用户差距不大。七个月间调试会话占比下降近一半,使用转向端到端智能体任务(部署运行代码、分析数据、编写非代码文档),典型任务价值平均上升约25%。 智能体 Anthropic 编码 论文/研究 推荐理由: 这份报告用40万次真实会话数据揭示了一个反直觉发现,决定Agent编码成败的,不是会不会写代码,而是对自己领域问题的理解深度。对非技术背景用AI编程的

Anthropic 政策/监管 行业动态 OpenAI 安全/对齐 论文/研究 智能体 编码 Meta 现象/趋势 部署/工程 DeepSeek Microsoft 开源生态 教程/实践 产品更新
AI HOT ·

智能体AI治理:你的API密钥就是护栏

13:58 OpenRouter:Announcements(RSS) 精选 68 智能体AI使用量将在未来两年急剧上升,但治理滞后——仅五分之一企业拥有成熟治理模型。典型事故:销售智能体重试失败调用后自行升级到GPT-5.5,一夜消耗200美元。API路由层位于智能体与模型之间,是强制执行预算上限、模型白名单、提供方准入和请求日志的理想点。IBM报告指出97%遭遇AI安全事件的组织缺乏AI访问控制。最小可行治理方案:为每个智能体工作流分配独立API密钥,在API密钥层面实现预算控制、模型准入和审计追踪。 智能体 现象/趋势 部署/工程 推荐理由: 现在代理失控的风险越来越真实,这篇文章把复杂的治理问题简化为五个 API 密钥控制,五分钟就能落地,比那些大而无当的框架实用得多。

智能体 现象/趋势 部署/工程