AI and technology watch

AI 新闻

聚合过去 24 小时 AI 与开发者生态动态,并提供来源链接以便深入阅读。

---
AI HOT ·

xAI 开源 Grok CLI 代码库中发现 Mermaid 转 Unicode 框图工具

08:45 Simon Willison 博客 精选 72 xAI 开源的 Grok CLI 编码智能体代码库中包含一个用 Rust 编写的 Mermaid 图表示例终端渲染器 xai-grok-markdown/src/mermaid.rs 。开发者通过 Claude Code for web (Fable 5) 将其编译为 WebAssembly,实现在浏览器中运行该工具。 开源/仓库 教程/实践 推荐理由: Simon 从 Grok 源码里扒出终端 Mermaid 渲染器,用 Wasm 带到浏览器,生成 Unicode 图,开发者画流程图的轻量选择。

开源/仓库 教程/实践
AI HOT ·

MiniMax Code 2.0 桌面端焕新:底层架构全面升级,金融模块即将上线

09:40 公众号:MiniMax(稀宇科技) 精选 66 MiniMax Code 2.0 桌面端发布,基于 Pi Agent 框架重构底层架构,显著提升会话启动速度与长程复杂任务的执行稳定性。新版本优化了图表加载与文件预览框选编辑功能,并已与恒生金融数据库、企查查 MCP 打通,金融模块即将上线,支持多源数据实时检索与专业报告生成。桌面端现已开放下载,本月还将上线远程控制、浏览器操控等功能。 智能体 MCP/工具 产品更新 编码 推荐理由: MiniMax Code 2.0 把底层推倒重来,金融模块直接打通恒生和企查查,从写代码变成能出分析报告,做二级市场的可以认真看看。

智能体 MCP/工具 产品更新 编码
Moonshot AI:Kimi Blog ·

Moonshot AI 发布 PerceptionBench:多模态模型视觉感知能力诊断基准

Moonshot AI 发布 PerceptionBench,一个从 40 多个现有基准中模型实际失败案例归纳出的视觉感知基准,包含 10 项原子感知能力和 3000 道验证题。所有测试模型准确率均未超过 60%,且大量正确答案在重复提问时无法复现,表明模型更多是猜测而非真正感知。PerceptionBench 旨在精确诊断多模态 AI 的视觉感知断裂点,推动其实现忠实、一致的视觉理解。

多模态 评测/基准
VentureBeat:AI(RSS) ·

54%企业已遭遇AI智能体安全事件,多数仍共享凭证

VentureBeat调查107家企业发现,54%已遭遇AI智能体安全事件(18%确认事故,36%险些酿祸)。仅32%为每个智能体分配独立身份凭证,30%将高风险智能体隔离在沙箱中。安全工具主要依赖模型提供商原生方案,专用智能体安全产品渗透率极低。

智能体 安全/对齐 现象/趋势
Hacker News 热门(buzzing.cc 中文翻译) ·

Decoy 字体:用空间频率混淆让 AI 看不清你输入的文字

Decoy Font 是一款 TTF 字体,通过在同一字符中叠加不同空间频率的图形(前景细轮廓与背景低频模糊块),使近距离观看时 AI 读到"诱饵"字母,而人眼远距离或眯眼时才能看到真实隐藏信息。

产品更新 安全/对齐
Claude:Blog(网页) ·

Anthropic 用 Claude Code 大规模迁移代码:Bun 百万行 Zig 转 Rust,两周完成

Anthropic 工程师用 Claude Code 在两周内将 Bun 的百万行 Zig 代码迁移至 Rust,100% 现有测试通过,合并后出现 19 个回归问题已全部修复。另一工程师用周末将 Python 代码库迁移至 16.5 万行 TypeScript。迁移消耗约 16.5 万美元 API 成本,但编译时间从八分钟降至两秒,二进制启动快 6 倍。

Anthropic 教程/实践 编码 部署/工程
VentureBeat:AI(RSS) ·

企业AI智能体评估存在"现实对齐"缺口:半数组织曾将通过内部测试的智能体部署到生产环境后导致客户故障

对157家企业的调查显示,50%的组织在过去一年曾部署通过内部评估但导致客户故障的AI智能体或大语言模型功能,5%的企业完全信任自动化评估,29%认为评估与现实结果对齐不佳是最大局限。尽管信任度低,66%的企业已允许或正计划在12个月内实现低风险智能体的全自动、无人工干预部署。

智能体 现象/趋势
AI HOT ·

前谷歌DeepMind研究员因公司签署无限制军事AI协议而离职

04:02 Hacker News 热门(buzzing.cc 中文翻译) 精选 73 前谷歌DeepMind研究员Alex Turner因谷歌向国土安全部出售云服务并最终签署无限制军事AI协议而离职。他曾起草25页提案要求加入禁止杀手机器人和大规模监控的合同条款,但提案被CEO转交后无人跟进。Turner指出,包括Jeff Dean和Stuart Russell在内的多位AI伦理领袖在关键时刻未能兑现承诺。 Anthropic Google 安全/对齐 现象/趋势 推荐理由: Alex Turner用亲身经历戳穿了AI巨头们的伦理承诺,Jeff Dean、Stuart Russell等名人在关键时刻失声,这份记录比任何声明都真实。

Anthropic Google 安全/对齐 现象/趋势
Claude:Blog(网页) ·

Cursor 评估负责人确认 Claude Fable 5 在 CursorBench 达 72.9% 新高

Cursor 的模型评估负责人 Nate Schmidt 发现,Claude Fable 5 在其内部基准 CursorBench 上以 Max effort 模式达到 72.9%,创下新高。该模型在模糊的真实编程任务中表现出全局推理能力,例如在航天模拟器中仅凭一句提示自主规划并成功登月,而此前 Claude Opus 运行 12 小时以上仍无结果。

技巧观点
Google Blog:AI(RSS) ·

Google Vids 上线 Gemini Omni 与个人数字分身功能

Google Vids 推出两项更新:Gemini Omni 支持用户通过自然语言提示词和图片参考生成、逐步编辑高质量视频片段;个人数字分身功能允许用户上传自拍和语音录制后,输入文字即可让数字分身出镜。两项功能面向 Google AI Pro 和 Ultra 订阅者及 Google Workspace 商业客户开放,所有生成内容均含不可见的 SynthID 数字水印。

Google 产品更新 视频
AI HOT ·

Anthropic 新研究:2026 年夏季的智能体行为偏差。 在我们的敲诈实验一年后,我们又发现了四种当今自主 AI 智能体在模拟中行为不当的方式。 了解更多:https://alignment.anthropic.com/2026/agentic-misalignment-summer-2026/

02:12 Anthropic @ AnthropicAI 精选 73 智能体 Anthropic 安全/对齐 推荐理由: 去年敲诈实验后,Anthropic 又发现四种智能体在模拟中行为不当的新方式,这份研究是安全对齐领域绕不开的实证,做智能体的人该读一读。

智能体 Anthropic 安全/对齐
IT之家(RSS) ·

世界人工智能合作组织协定签署仪式在上海举行,总部设中国上海

7月16日,成立世界人工智能合作组织协定签署仪式在上海举行,中共中央政治局委员、外交部长王毅代表中国政府签署协定。该组织是独立的政府间国际组织,总部设在中国上海,旨在促进人工智能国际合作与全球治理。哈萨克斯坦、老挝、巴基斯坦等29个国家代表签署协定成为创始成员国。

安全/对齐 政策/监管 智能体 Anthropic 产品更新 GitHub 开源生态 搜索 部署/工程 Google arXiv 推理 论文/研究 行业动态 MCP/工具 教程/实践 语音 数据/训练 视频 编码 开源/仓库 OpenAI xAI 现象/趋势 多模态 模型发布
Claude:Blog(网页) ·

在 Claude Cowork 中使用 Claude Fable 5

Anthropic 发布最强通用模型 Claude Fable 5,专为长时间、多步骤的复杂异步工作设计,可在 Claude Cowork 中自主执行深度研究、尽职调查等任务。该模型需手动选择,默认模型为 Claude Sonnet 5。

智能体 Anthropic 产品更新
AI HOT ·

OpenAI 发布 GPT-Red:通过自动化红队测试提升模型鲁棒性

01:09 OpenAI:官网动态(RSS · 排除企业/客户案例) 精选 67 OpenAI 训练了自动化红队模型 GPT-Red,用于在部署前发现漏洞并在训练中生成攻击以提升模型鲁棒性。GPT-Red 能攻破此前几乎所有模型,其攻击被用于对抗训练 GPT-5.6 Sol,使该模型在直接提示注入基准测试中的失败率降至四个月前最佳生产模型的 1/6。GPT-Red 通过自对弈强化学习训练,投入了 OpenAI 后训练中前所未有的计算规模。 OpenAI 安全/对齐 数据/训练 另有 4 家信源报道 X:Greg Brockman (@gdb) IT之家(RSS) The Decoder:AI News(RSS) X:OpenAI (@OpenAI) 推荐理由: OpenAI 用自博弈训练出的红队模型 GPT-Red,把直接提示注入攻击成功率压到了 0.05%,而且没有降低模型能力。做 AI 安全的人应该好好读一下他们怎么实现这个飞轮的。

OpenAI 安全/对齐 数据/训练
AI HOT ·

今天,我们推出 Inkling。 Inkling 能高效地对文本、图像和音频模态进行推理。我们将提供完整权重。 https://thinkingmachines.ai/news/introducing-inkling/ 即日起可在 Tinker 上进行微调。在 Inkling Playground 中试用。🧵

02:09 Thinking Machines @ thinkymachines 精选 70 多模态 开源/仓库 推理 模型发布 另有 9 家信源报道 X:Testing Catalog (@testingcatalog) IT之家(RSS) The Decoder:AI News(RSS) TechCrunch:AI(RSS) Hacker News 热门(buzzing.cc 中文翻译) X:Artificial Analysis (@ArtificialAnlys) X:Rohan Paul (@rohanpaul_ai) X:邵猛 (@shao__meng) X:歸藏 (@op7418) 推荐理由: 多模态推理终于有了开放权重的选项,Inkling不是最强的,但可能是最方便你上手微调的。想试试多模态Agent的,今天就能在Playground玩。

多模态 开源/仓库 推理 模型发布
AI HOT ·

AI语音诈骗:退休老人因合成女儿哭声被骗1.5万美元

01:00 Hacker News 热门(buzzing.cc 中文翻译) 精选 72 2025年夏季,美国佛罗里达州一名退休老人接到“女儿”哭诉车祸需保释金的电话,一小时内取现1.5万美元交给冒充法院的快递员——实际上,哭声是从一段音频片段合成的AI语音。FBI 2026年4月报告首次将AI欺诈列为独立类别,2025年收到超2.2万起AI相关投诉,调整后损失超8.93亿美元,其中60岁以上受害者占3.52亿美元。 安全/对齐 语音 推荐理由: FBI首次将AI诈骗单独统计,老年人成最大受害群体。这篇分析点破了防范盲区:别再指望靠人分辨真假语音,责任该压在银行和平台身上。

安全/对齐 语音
X:面壁智能 OpenBMB (@OpenBMB) ·

面壁智能开源企业AI数字员工平台StaffDeck

面壁智能联合多团队开源StaffDeck,一个用于构建与管理数字员工的企业平台。该平台旨在将专业知识、标准作业程序(SOP)和决策规则转化为持续工作、改进并保留组织知识的数字员工,而非传统聊天机器人。项目代码已发布于GitHub。

智能体 GitHub 产品更新 开源生态
公众号:百度智能云(文心) ·

秒哒 3.5 全球首发 iOS App,无代码开发与多端共享后端能力升级

百度智能云在 WAIC2026 发布秒哒 3.5,新增 iOS 打包能力,用户无需 Mac 或 Xcode 即可将应用打包为 IPA 文件或上架 App Store。3.5 版本还内置 SEO Agent 实现搜索优化自动化,支持多应用共享同一后端数据库,并推出数据库多环境隔离与后端资源分级功能。秒哒累计服务超 3500 万用户,已创造 350 万个商业应用。

智能体 产品更新 搜索 部署/工程