智谱发布GLM-5.2:开源权重与1M上下文
5 3 信源 · 6小时前
AI and technology watch
聚合过去 24 小时 AI 与开发者生态动态,并提供来源链接以便深入阅读。
5 3 信源 · 6小时前
22:30 公众号:小米 MiMo 精选 69 小米推出云端轻量化 Claw 类产品 MiMo Claw 正式版,搭载与 OpenClaw 框架深度适配的 MiMo-V2.5-Pro 旗舰模型。该模型原生兼容 MCP 工具调用协议,内置百万级超长上下文,支持单会话千次以上连续工具调用;依托 MTP 三层解码架构,在 OpenClaw 标准 Agent 工作流中吞吐效率提升约 3 倍。ClawEval 测试中任务达标率(Pass³)达 63.8%,Token 消耗较同类产品降低 40%-60%。联动金山办公生态,提供 Word、Excel、PPT、PDF 等格式的 AI 生成、预览与在线编辑一站式服务。免费用户每日单次体验时长从1小时升级至4小时,面向高频用户推出 TokenPlan 分层订阅(Lite/Standard/Pro/Max),支持灵活叠加,限时定价14.9元/月、19.9元/月、233.8元/年。 智能体 MCP/工具 产品更新 关联讨论 2 条 IT之家(RSS) X:小米 MiMo (@XiaomiMiMo) 推荐理由: 小米给普通人用的 Agent 工具正式上线,14.9 元月费很激进,但核心还是看实际任务完成率和办公集成靠不靠谱。 22:16 Elon Musk @ elonmusk 精选 70 AI 将实现 Stockfish 级别的编码和通用计算机使用 SpaceX : SpaceX has exercised the option to acquire @cursor_ai in an all-stock transaction with the goal of building the world's ... xAI 编码 行业动态 关联讨论 4 条 X:小互 (@xiaohu) X:歸藏 (@op7418) X:宝玉 (@dotey) X:Emad Mostaque (@EMostaque) 推荐理由: SpaceX 全资收购 Cursor,同时 xAI 与 Cursor 联合训练的模型即将发布,Musk 放话要做出 Stockfish 级别的编码能力。不管最终是否兑现,AI 编程工具的格局都要变一变了。 21:30 公众号:数字生命卡兹克 精选 67 WorkBuddy日活飙升至行业第二的3-4倍,非技术用户涌入 从3月至今,WorkBuddy日活用户数已达行业第二名的3-4倍,用户不再限于开发者,大量HR、运营、行政等非技术岗位也在使用。其企业版和项目功能进一步扩展了Agent办公场景。同期,Trae Work、QoderWork、Kimi Work等产品纷纷改名或出新,争夺市场。腾讯云认为这可能是十年一遇的机遇。 智能体 现象/趋势 推荐理由: 卡兹克从现场带回WorkBuddy的用户数据,非技术人群用Agent干活不再
22:16 Elon Musk @ elonmusk 精选 70 SpaceX : SpaceX has exercised the option to acquire @cursor_ai in an all-stock transaction with the goal of building the world's ... xAI 编码 行业动态 关联讨论 4 条 X:小互 (@xiaohu) X:歸藏 (@op7418) X:宝玉 (@dotey) X:Emad Mostaque (@EMostaque) 推荐理由: SpaceX 全资收购 Cursor,同时 xAI 与 Cursor 联合训练的模型即将发布,Musk 放话要做出 Stockfish 级别的编码能力。不管最终是否兑现,AI 编程工具的格局都要变一变了。
21:17 Hacker News 热门(buzzing.cc 中文翻译) 精选 78 据Hacker News热门文章,OpenAI在2025年亏损额激增近8倍,年度总支出达到340亿美元。原文来自wheresyoured.at的独家财务分析报道,该信息在Hacker News上获得超过100个点赞。 OpenAI 行业动态 关联讨论 2 条 Ars Technica:AI(RSS) The Decoder:AI News(RSS) 推荐理由: 独家披露的 OpenAI 财务数据把 AI 行业的烧钱真相摆上了台面,亏损一年涨 8 倍意味着商业化压力已到临界点,这比任何技术参数都更能定义下一阶段的行业走向。
21:30 The Decoder:AI News(RSS) 精选 80 美国司法部在一份驳回诉讼的动议中称,xAI的聊天机器人Grok对军事行动至关重要,以此为其在密西西比州Southaven的Colossus 2设施运行未经许可的燃气轮机辩护。NAACP已提起诉讼,指控xAI的燃气轮机数量从4月的27台增至57台,导致氮氧化物排放飙升111%。国防部首席数字与人工智能官Cameron Stanley表示,Grok是支持机密和绝密网络军事任务的四款AI模型之一,包括近期针对伊朗的打击。 xAI 行业动态 推荐理由: 司法部用国家安全为 xAI 的环境违规辩护,还首次承认 Grok 支援了对伊朗军事行动,AI 成为战争工具再无遮掩。
21:30 公众号:数字生命卡兹克 精选 67 从3月至今,WorkBuddy日活用户数已达行业第二名的3-4倍,用户不再限于开发者,大量HR、运营、行政等非技术岗位也在使用。其企业版和项目功能进一步扩展了Agent办公场景。同期,Trae Work、QoderWork、Kimi Work等产品纷纷改名或出新,争夺市场。腾讯云认为这可能是十年一遇的机遇。 智能体 现象/趋势 推荐理由: 卡兹克从现场带回WorkBuddy的用户数据,非技术人群用Agent干活不再是口号,传统办公软件的危机比想象中来得更快。
05:57 DogeDesigner @ cb_doge 精选 80 Microsoft xAI 产品更新 推荐理由: Grok集成进PowerPoint是xAI在办公场景落地的第一次大考,也是普通用户最容易上手Grok的方式,视频里的生成速度确实惊人。 03:52 OpenAI:Alignment 研究博客(RSS) 精选 73 公开聊天数据能否预测真实世界AI失调? OpenAI利用WildChat公开数据集(2023年4月至2024年5月收集的100万条对话)模拟模型部署,预测GPT-5.1、GPT-5.2、GPT-5.4在真实生产环境中的不良行为率。与私有生产数据对比发现,WildChat模拟的平均预测误差约3倍;但对技术性和智能体型失调的预测精度下降。研究验证了公开数据集作为外部审计工具的可行性。 OpenAI 安全/对齐 论文/研究 推荐理由: 用公开旧聊天数据预测模型真实失败率,误差居然在 3 倍以内,做外部审计的可以认真看看。不过 agentic 场景明显不行,需要新数据集。 03:35 Anthropic:Research(发表成果 · 网页) 精选 76 Anthropic:智能体编码中专业知识回报持续存在 Anthropic 基于约40万次 Claude Code 交互会话(2025年10月至2026年4月)分析发现:人类主导规划决策(做什么),Claude 主导执行决策(怎么做)。领域专业知识越强,模型每次指令完成的工作量越多。各类职业完成任务的成功率与软件工程师平均相近;领域专家成功率更高,但与中级用户差距不大。七个月间调试会话占比下降近一半,使用转向端到端智能体任务(部署运行代码、分析数据、编写非代码文档),典型任务价值平均上升约25%。 智能体 Anthropic 编码 论文/研究 推荐理由: 这份报告用40万次真实会话数据揭示了一个反直觉发现,决定Agent编码成败的,不是会不会写代码,而是对自己领域问题的理解深度。对非技术背景用AI编程的人和产品经理都是重要信号。 03:25 OpenAI:官网动态(RSS · 排除企业/客户案例) 精选 74 OpenAI 发布 Deployment Simulation 方法:通过模拟部署预测模型发布前行为 OpenAI 近日发布 Deployment Simulation 方法,通过在隐私保护下重放历史对话、用新候选模型重新生成回复,模拟模型上线后的实际表现。在多个 GPT‑5‑series Thinking 部署中,该方法比传统评估更准确地估计了不良行为频率,发现新型对齐问题,并降低模型识别测试的风险。它还能扩展至涉及工具使用的智能体场景。传统评估存在覆盖不足、选择偏差和模型可识别测试等局限,而 Deployment Simulation 使用真实对话分布缓解了这些问题,但无法测量
19:47 TechCrunch:AI(RSS) 精选 74 SpaceX 在历史性 IPO 数天后,同意以 600 亿美元股票收购 AI 编程初创公司 Cursor,旨在帮助其围绕 xAI 构建的 AI 部门追赶主要 AI 实验室。此前 Cursor 正接近完成一轮 20 亿美元融资,估值 500 亿美元,投资方包括 Andreessen Horowitz、Thrive 和 Nvidia。SpaceX 在 IPO 期间向投资者表示,其 AI 产品可寻址市场达 26 万亿美元。交易预计于今年第三季度完成。 编码 行业动态 关联讨论 8 条 The Verge:AI(RSS) IT之家(RSS) X:Testing Catalog (@testingcatalog) Hacker News 热门(buzzing.cc 中文翻译) X:阿易 AI Notes (@AYi_AInotes) X:Michael Truell (@mntruell) The Decoder:AI News(RSS) Ars Technica:AI(RSS) 推荐理由: SpaceX 收购 Cursor 不只是天价交易,更是马斯克 AI 版图拼上关键一块,对 AI 编程工具市场格局冲击不小。
04:24 Chubby♨️ @ kimmonismus 精选 93 美国商务部长Howard Lutnick告知Anthropic,出口其最新模型Fable 5和Mythos 5至全球任何地方均需政府许可,甚至禁止向任何国籍的海外人士提供。Lutnick在信件中威胁,若不遵守将面临刑事和民事处罚。Anthropic回应:禁用这两个模型。推文作者指出,连友好国家也被排除在SOTA模型之外,AI正从私人公司转向政府控制。该信件全文由Bloomberg公开。 Bloomberg : Read the full text of the letter from US Commerce Secretary Howard Lutnick to Anthropic CEO Dario Amodei. https://www.bl... Anthropic 政策/监管 行业动态 推荐理由: 美国政府首次对具体AI模型实施出口管制,Anthropic被迫禁用Fable 5和Mythos 5,SOTA模型成了战略武器。做国际业务的团队必须马上看一遍合规风险。 03:52 OpenAI:Alignment 研究博客(RSS) 精选 73 公开聊天数据能否预测真实世界AI失调? OpenAI利用WildChat公开数据集(2023年4月至2024年5月收集的100万条对话)模拟模型部署,预测GPT-5.1、GPT-5.2、GPT-5.4在真实生产环境中的不良行为率。与私有生产数据对比发现,WildChat模拟的平均预测误差约3倍;但对技术性和智能体型失调的预测精度下降。研究验证了公开数据集作为外部审计工具的可行性。 OpenAI 安全/对齐 论文/研究 推荐理由: 用公开旧聊天数据预测模型真实失败率,误差居然在 3 倍以内,做外部审计的可以认真看看。不过 agentic 场景明显不行,需要新数据集。 03:35 Anthropic:Research(发表成果 · 网页) 精选 76 Anthropic:智能体编码中专业知识回报持续存在 Anthropic 基于约40万次 Claude Code 交互会话(2025年10月至2026年4月)分析发现:人类主导规划决策(做什么),Claude 主导执行决策(怎么做)。领域专业知识越强,模型每次指令完成的工作量越多。各类职业完成任务的成功率与软件工程师平均相近;领域专家成功率更高,但与中级用户差距不大。七个月间调试会话占比下降近一半,使用转向端到端智能体任务(部署运行代码、分析数据、编写非代码文档),典型任务价值平均上升约25%。 智能体 Anthropic 编码 论文/研究 推荐理由: 这份报告用40万次真实会话数据揭示了一个反直觉发现,决定Agent编码成败的,不是会不会写代码,而是对自己领域问题的理解深度。对非技术背景用AI编程的
5 5 信源 · 2小时前
13:58 OpenRouter:Announcements(RSS) 精选 68 智能体AI使用量将在未来两年急剧上升,但治理滞后——仅五分之一企业拥有成熟治理模型。典型事故:销售智能体重试失败调用后自行升级到GPT-5.5,一夜消耗200美元。API路由层位于智能体与模型之间,是强制执行预算上限、模型白名单、提供方准入和请求日志的理想点。IBM报告指出97%遭遇AI安全事件的组织缺乏AI访问控制。最小可行治理方案:为每个智能体工作流分配独立API密钥,在API密钥层面实现预算控制、模型准入和审计追踪。 智能体 现象/趋势 部署/工程 推荐理由: 现在代理失控的风险越来越真实,这篇文章把复杂的治理问题简化为五个 API 密钥控制,五分钟就能落地,比那些大而无当的框架实用得多。
15:05 🚨 AI News | TestingCatalog @ testingcatalog 精选 75 Karan Goel : We released Sonic-3.5 and Ink-2, the #1 streaming models for text to speech and speech to text you can use in your voice... 智能体 模型发布 语音 推荐理由: Cartesia 同时发布实时语音合成和识别两个模型的迭代版,双双登顶第三方基准,80ms 首音频延迟让语音代理的交互感接近真人,做实时语音应用的开发者可以重点看一下。
16:40 MarkTechPost(RSS) 精选 71 Google Cloud 发布 Open Knowledge Format (OKF) v0.1,一种供应商中立的 Markdown 规范,为 AI 智能体提供结构化上下文知识。OKF 将知识表示为带 YAML 前置元数据的 markdown 文件目录,每个概念对应一个文件,通过 `type`、`title`、`description` 等少量保留字段实现互操作。无需专有服务、SDK 或运行时,目录可托管在 GitHub、以 tarball 传输或挂载到任意文件系统。OKF 旨在解决组织内部知识碎片化问题——表结构、指标定义、runbook 等散落在不同 catalog 和 wiki 中,各厂商方案互不兼容。遵循最少意见原则,只强制 `type` 字段,生产者和消费者可独立实现。使用场景包括数据团队将 BigQuery 表定义导出为代码、为智能体存储 incident runbook、跨组织知识交换等。 智能体 Google MCP/工具 产品更新 推荐理由: 这是 Karpathy LLM Wiki 思想的首个工业级标准化尝试,把散落在各处的内部知识统一成 agent 可读的 markdown 规范,对构建 AI 应用的团队是切实的工程改进,值得加入设计检查清单。
17:57 The Decoder:AI News(RSS) 精选 72 中国 AI 初创公司 DeepSeek 完成首轮外部融资,募资超 500 亿元人民币(约 74 亿美元),估值超 500 亿美元。投资结构特殊:多数投资者将资金投入 CEO 梁文锋管理的有限合伙企业,无投票权且锁定期五年;仅国资 AI 基金直接投资并保留投票权。创始人梁文锋个人投入约 200 亿元,腾讯和宁德时代为主要外部投资者。梁文锋表示优先基础 AI 研究与 AGI 开发,将继续开源。DeepSeek 去年初凭 V3、R1 模型获全球关注,今年 4 月发布运行于华为芯片的最大开源权重模型 V4,并将 V4 Pro 永久折扣 75%,输入价格约为 OpenAI GPT-5.5 的 1/11,输出价格约为 1/35。 DeepSeek 开源生态 行业动态 推荐理由: DeepSeek 首次外部融资估值冲到 500 亿美元,交易结构却排除了投资人话语权,看得出梁文锋仍把控制权抓得很紧,开源路线和极致性价比是最大的筹码。
12:39 Qwen:Blog Retrieval(API) 精选 72 Qwen-RobotWorld以语言为统一动作接口,采用双流Multimodal Diffusion Transformer(MMDiT)架构,将Qwen2.5-VL作为动作编码器。在4个基准测试中取得顶尖成绩,统一20余种机器人形态,基于860万跨场景训练对和1300多项操作技能。语言接口标准化500多种动作类别,支持操作、自动驾驶、室内导航的联合训练。还支持Scene2Robot人类到机器人转移及2–4路多视角几何一致视频生成。 具身智能 多模态 模型发布 推荐理由: 具身智能的世界模型长期受限于单一形态,Qwen-RobotWorld用语言统一动作接口,把操作、驾驶、导航合训,多视角几何一致性和人类演示迁移是过去一年最扎实的落地信号,做机器人的别错过。
12:39 Qwen:Blog Retrieval(API) 精选 72 Qwen-RobotManip 是通义千问基于 Qwen-VL 的视觉-语言-动作(VLA)基础模型,引入覆盖表示、运动和行为三维度的统一对齐框架。仅使用开源机器人数据集和人演示视频,构建约 38,100 小时预训练语料,涵盖 15 种机器人形态。在 LIBERO-Plus 达 91.4%,RoboTwin-C2R Hard 达 69.4%,RoboCasa365 Composite-Unseen 达 14.9%,EBench 达 45.6%,RoboTwin-IF 达 72.0%,并在 RoboChallenge Table30 v1 generalist track 夺冠。模型采用 80 维状态-动作表示、人-机器人数据合成管道(1,933 小时第一人称视频转 24,808 小时数据)及上下文策略适配。 具身智能 开源生态 数据/训练 模型发布 推荐理由: Qwen 这次发布的机器人模型,用统一对齐框架把跨实体数据规模化训练跑通了,OOD 泛化大幅领先,做具身智能的值得认真看一下。
13:58 OpenRouter:Announcements(RSS) 精选 75 13个平台提供免费LLM API,含永久免费层与试用额度。OpenRouter拥有20+免费模型,单密钥无需信用卡;Groq以约320 tokens/秒运行Llama 3.3 70B;Google AI Studio支持1M上下文;Mistral实验层约10亿token/月但需同意数据训练;Cerebras约1M token/天;GitHub Models提供GPT-4o、Claude 3.5 Sonnet等前沿模型。各免费层有速率限制、数据训练授权、上下文缩减等隐藏成本,建议早期测试2-3个方案并设置故障转移。 评测/基准 部署/工程 推荐理由: 免费 LLM API 不是免费的,这篇文章把 13 家平台的隐藏成本、速率限制和真实可用性都算清楚了,想省钱的开发者值得花五分钟看一遍。
4 6 信源 · 11分钟前
12:39 Qwen:Blog Retrieval(API) 精选 70 Qwen 发布 Qwen-RobotNav,基于 Qwen3-VL 在 15.6M 样本上训练,统一了视觉语言导航、目标导航、目标跟踪、自动驾驶和具身问答五个领域,无需修改架构即可在推理时切换任务模式和观察参数。模型在多项基准取得 SOTA:VLN-CE RxR 成功率 76.5%,HM3Dv2 目标导航 75.6%(仅 RGB),EVT-Bench 跟踪率 90.0%,NAVSIM PDMS 91.4,以及三项 EQA 新标杆。模型暴露四个可调轴(视觉 token 预算、时间衰减、相机权重、帧采样模式)。作为智能体系统的一部分,上层规划器 Qwen3.7-Plus 在 EXPRESS-Bench 上提升 15.4%,导航步数减少 77%。模型已零样本部署在 Unitree Go2 四足机器人上,无需环境微调。 具身智能 模型发布 关联讨论 4 条 Qwen:Blog Retrieval(API) 公众号:通义实验室(千问) X:通义千问 / Qwen (@Alibaba_Qwen) MarkTechPost(RSS) 推荐理由: 把导航任务看作上下文配置问题,单一模型覆盖从跟随指令到自动驾驶五种任务,在四足机器人上零样本部署,具身智能的工程化样本。
10:00 IT之家(RSS) 精选 70 字节跳动火山引擎旗下火山方舟体验中心于 6 月 15 日上线 Seedance 2.0 Mini 视频生成模型,计划近期开放 API。该模型比 Seedance 2.0 Fast 快 2 倍,输出质量相当。图生视频定价 0.023 元/千 tokens,视频生视频 0.014 元/千 tokens,720P 规格下单秒生成成本约 0.5 元,较 Seedance 2.0 标准版降低约一半。模型面向电商内容生产、营销素材批量生成、UGC 创作及特效玩法等高频率、大规模视频生成场景。 模型发布 视频 推荐理由: Seedance 2.0 Mini 把视频生成成本压到 0.5 元/秒,比标准版便宜一半,对做大批量电商素材和 UGC 的团队是个实际信号,值得等 API 开放后看实测。
有任何建议或问题,欢迎告诉我们
感谢您的反馈!