AI and technology watch

AI 新闻

聚合过去 24 小时 AI 与开发者生态动态,并提供来源链接以便深入阅读。

---
AI HOT ·

MosaicLeaks: 你的研究智能体能保守秘密吗?

02:47 Hugging Face:Blog(RSS) 精选 75 深度研究智能体在结合私有本地文档与外部网页检索时存在隐私泄露风险。MosaicLeaks 提出包含 1,001 条多跳研究链的新任务,每条链交错混合本地与公共子问题。测试发现智能体频繁泄露私有信息,单纯优化任务性能反而加剧泄露。基于此,研究提出隐私感知深度研究(PA-DR)强化学习训练方法,将严格链成功率从 48.7% 提升至 58.7%,同时将答案/全面信息泄露率从 34.0% 降至 9.9%。 智能体 arXiv 安全/对齐 论文/研究 推荐理由: 这篇论文揭示了深度研究agent的多跳查询会像马赛克一样拼凑出私密信息,单纯提示减少泄露几乎没用,而隐私感知训练把泄露率从34%降到9.9%,且不损伤任务表现,做企业级agent产品的团队要重视。

智能体 arXiv 安全/对齐 论文/研究
AI HOT ·

Claude Enterprise 推出企业托管 MCP 连接器授权管理

01:51 Claude:Blog(网页) 精选 68 Claude Enterprise 推出企业托管授权功能,管理员可通过身份提供商(率先支持 Okta)为整个组织配置 MCP 连接器。用户首次登录 Claude 时自动获得授权,无需手动操作,实现零接触设置。该功能基于 Model Context Protocol 的 Enterprise-Managed Authorization 扩展构建,支持 Asana、Atlassian、Canva、Figma、Granola、Linear、Supabase 等 MCP 提供商,Slack 即将支持。授权管理集成到现有 IdP 工作流中,可按组限定范围、通过 IdP 快速撤销授权,并支持要求连接器仅通过 IdP 连接以隔离工作与个人使用。 Anthropic MCP/工具 产品更新 部署/工程 推荐理由: 企业 MCP 连接器不再需要每个用户手动授权,这是 MCP 生态从个人扩展到组织的关键一步,管理员终于可以像管理其他 SaaS 一样管理 Claude 的工具链。

Anthropic MCP/工具 产品更新 部署/工程
AI HOT ·

驾驭 Claude Code:CLAUDE.md、技能、钩子、规则、子智能体等

01:51 Claude:Blog(网页) 精选 72 Claude Code 提供七种自定义指令方式:CLAUDE.md(根目录始终加载,子目录按需加载)、规则(无范围或路径范围)、技能(按需调用,共享 token 预算)、子智能体(隔离上下文运行并返回最终消息)、钩子(生命周期事件触发,绕过压缩)、输出样式(注入系统提示,永不压缩)和附加系统提示(CLI 标志,仅单次有效)。每种方式在加载时机、压缩行为、上下文成本和适用场景上各有不同,例如 CLAUDE.md 适合存放构建命令与编码规范,路径范围规则避免无关上下文消耗,子智能体用于并行隔离任务,钩子用于确定性自动化(如运行 linter 或备份聊天记录)。 Anthropic MCP/工具 教程/实践 编码 推荐理由: 如果你用Claude Code,这篇把定制化方法讲透了,从何时用技能到何时用钩子,比扒拉文档高效得多。

Anthropic MCP/工具 教程/实践 编码
AI HOT ·

AI数据中心获政府强制电网快车道

01:49 TechCrunch:AI(RSS) 精选 70 美国联邦能源监管委员会(FERC)命令六大电网运营商为数据中心等大型用户提供快速并网通道,数据中心需承担并网费用。FERC同时要求运营商考虑“替代输电技术”,并在30天内报告剩余发电容量、60天内审查本区域电价。指令并未解决发电容量短缺问题。数据中心电力需求预计到2035年增长近三倍,而电网运营商此前长期应对近乎零的需求增长。据Bloomberg,部分地区批发电价较五年前上涨了267%。 政策/监管 推荐理由: 这个FERC指令给AI数据中心开了电网接入的快车道,但没解决发电容量短缺的根本问题,短期能推一批项目,长期还是缺电。

政策/监管
AI HOT ·

OpenAI IPO前连下两城:招揽Transformer共同作者及前白宫AI政策官员

04:19 TechCrunch:AI(RSS) 精选 70 OpenAI在IPO前夕连招两位重量级人物:Google DeepMind AI先驱、Transformer架构共同作者Noam Shazeer,以及前特朗普白宫AI政策官员Dean Ball。Shazeer此前通过27亿美元收购协议重返Google,此次离职加盟OpenAI。Ball将于7月6日加入,领导新组建的Strategic Futures团队,向首席战略官Jason Kwon汇报,团队将负责前沿AI政策与内部治理,聚焦灾难性风险、递归自我改进、劳动力市场影响及前沿实验室与政府关系等议题。此举正值Anthropic因美国政府出口管制禁令被迫下架Fable 5和Mythos 5模型。 OpenAI 政策/监管 行业动态 关联讨论 1 条 Hacker News 热门(buzzing.cc 中文翻译) 推荐理由: 我觉得 OpenAI 在 IPO 前接连吸纳 Shazeer 和 Ball,表面看是常规招聘,实则是向市场和政策圈同步释放信号,很值得留意。

OpenAI 政策/监管 行业动态
AI HOT ·

这家韩国电信巨头是Anthropic"Mythos"争议的焦点

09:57 Hacker News 热门(buzzing.cc 中文翻译) 精选 76 美国政府对Anthropic最强大的AI模型Claude Mythos实施出口管制,导火索是该公司将访问权限授予韩国电信巨头SK Telecom,美方担忧SK Telecom与中国存在关联。随后亚马逊向白宫报告Mythos的公开版本Fable 5存在可被绕过的防护漏洞,加剧不信任。白宫命令Anthropic撤销所有外国国民(包括美国境内移民)对Mythos和Fable 5的访问权限,Anthropic因此完全禁用这两个模型。Mythos此前通过Project Glasswing向约150家组织开放,SK Telecom于本月早些时候获得访问权,其曾向Anthropic投资1亿美元。SK Telecom在2024年中国营收仅约190万美元,但其所属SK集团在华业务广泛,且与中国联通有过合资历史,引发审查。 Anthropic 政策/监管 关联讨论 4 条 Hacker News 热门(buzzing.cc 中文翻译) Steve Yegge:Medium(RSS) X:Kim (@kimmonismus) TechCrunch:AI(RSS) 推荐理由: 美国首次因特定公司的中国联系对AI模型实施出口管制,SK Telecom与中国的历史合作成为导火索,这让所有跨国AI合作都面临不可预测的地缘风险。

Anthropic 政策/监管
AI HOT ·

诺姆·沙齐尔加入OpenAI

04:55 Hacker News 热门(buzzing.cc 中文翻译) 精选 86 前Google研究员、Transformer架构共同作者诺姆·沙齐尔在X上宣布,他将加入OpenAI,并期待与那里的卓越团队合作。沙齐尔表示这是一个艰难的决定,同时对Google团队及其共同取得的成果感到无比自豪。 Google OpenAI 开源生态 行业动态 推荐理由: Noam Shazeer 加入 OpenAI,这是今年最重量级的一次人才流动,Character.AI 创始人和 Transformer 作者的一手动向,足以让行业重新评估双方的技术路线和人才战局。

Google OpenAI 开源生态 行业动态
AI HOT ·

OpenAI 与全球 60 个国家、49 种语言、26 个专科的数百名医生合作,通过医生主导的评估大幅提升了 GPT-5.5 Instant 在健康相关问题的智能水平,现已能与公司前沿 Thinking 模型(推理模型)相当。该模型每周为超过 2.3 亿 ChatGPT 用户服务,能更好识别紧急医疗需求、询问相关上下文、解释不确定性并简化复杂信息。由于面向所有 ChatGPT 免费用户开放,这些改进可惠及更多人。

02:52 Greg Brockman @ gdb 精选 79 OpenAI : GPT-5.5 Instant is now on par with our frontier Thinking models for health-related questions. Every week, more than 230 ... OpenAI 产品更新 推理 关联讨论 1 条 The Decoder:AI News(RSS) 推荐理由: GPT-5.5 Instant 在健康问题上赶上了最贵模型,免费用户能获得接近临床思维的回答质量。这是 AI 进入严肃医疗场景的一个可靠信号,健康类产品经理应该体验一下。

OpenAI 产品更新 推理
AI HOT ·

xAI 的 Grok TTS 模型在 @Vapi_AI 的 Humanness Index 盲测中以 96 分(真人 100 分)位居榜首。该指数选取同一声音和引文,经各模型克隆后由听众盲评。

01:21 xAI @ xai 精选 66 Vapi : Two days into blind voting of voice models on our Humanness IndexTM, and xAI's Grok TTS model is at the top of the pack.... xAI 模型发布 语音 推荐理由: xAI Grok TTS 在 Vapi 盲测里人类相似度 96 分,只差真人 4 分,这个分数很有说服力,做语音产品的值得去听听看,能直观感受语音合成的进步。

xAI 模型发布 语音
AI HOT ·

伯尼·桑德斯提出7万亿美元AI计划:对大型AI公司征收50%股票税

01:22 Ars Technica:AI(RSS) 精选 72 伯尼·桑德斯提出立法,对年AI销售额超2亿美元的公司征收50%股票税,建立价值约7万亿美元的主权财富基金。基金每年向每位美国公民发放超1000美元股息(5%年股息),并资助医疗、教育、住房。同时成立由总统提名、参议院确认的两党“民主AI独立委员会”,通过投票权阻止公司损害公共利益。法案还要求AI公司剥离非AI业务。该计划面临共和党国会和特朗普政府阻力。 政策/监管 现象/趋势 推荐理由: 桑德斯的7万亿计划大概率走不出国会,但它把「AI巨头该分多少给公众」这个博弈实实在在地摆上了台面,从自愿分红到强制征税,尺度一下拉到了顶,所有AI公司都得掂量一下政治反噬。

政策/监管 现象/趋势
AI HOT ·

Anthropic Project Fetch 第二阶段:Claude Opus 4.7 自主完成任务,速度比人类团队快约20倍

00:22 Anthropic:Research(发表成果 · 网页) 精选 77 Anthropic 发布 Project Fetch 实验第二阶段结果。在2024年8月原始实验中,配备 Claude Opus 4.1 的人类团队在操控四足机器人时显著超越无 AI 团队。新实验中,Claude Opus 4.7 无需人类协助即完成所有任务,速度比最快人类团队快约20倍,比无 Claude 团队快37倍以上,编码量减少近10倍。模型在传感器连接、路径规划等环节表现出色,但在精确移动沙滩球等闭环控制任务上仍存在困难。这些进展源于通用模型规模化,而非针对机器人领域的专项优化。 智能体 Anthropic 具身智能 论文/研究 关联讨论 1 条 X:Anthropic (@AnthropicAI) 推荐理由: Anthropic 用 Claude Opus 4.7 自主操作机器狗,比当初的人类志愿者快 18-37 倍,代码量却少了十倍。这让「语言模型上手物理工具」从假想变成了可视的进度条,做具身智能和 agent 的人都该看一眼。

智能体 Anthropic 具身智能 论文/研究
AI HOT ·

超越 LoRA:如何选择最佳参数高效微调技术?

23:47 Hugging Face:Blog(RSS) 精选 70 参数高效微调(PEFT)技术中,LoRA 占据绝对主导:Hugging Face Hub 上 20,834 张提及单一 PEFT 技术的模型卡中 20,509 张指向 LoRA(98.4%);外部站点 10,000 个检查点中 95.0% 是 LoRA;GitHub 搜索 `from peft import` 代码片段的 71.3% 结果为 LoRA。但研究者宣称其他技术超越 LoRA 的论文结果具备偏向性——调整学习率即可让 LoRA 匹配更优技术。Hugging Face 的 PEFT 库提供统一 API 实现 40 余种 PEFT 技术,并开始建立基准测试:在数学数据集上对 LLM 进行思维链推理微调,以帮助用户做出更优选择。 Hugging Face 教程/实践 数据/训练 推荐理由: HuggingFace 的 PEFT 团队用公平基准把 LoRA 拉下神坛,图像生成任务上 OFT 表现更好,而且切换只需改一行配置。对微调选型有实打实的参考价值,但数据集有限,别全信。 23:14 IT之家(RSS) 精选 76 我国首部L3/L4自动驾驶强制性国标公示:2027年7月起实施 工信部6月16日就《智能网联汽车自动驾驶系统安全要求》等2项强制性国标公开征求意见,公示至6月24日,建议2027年7月1日起实施。该标准系我国首部针对L3/L4的强制性国标,要求系统安全水平至少达到“合格且专注驾驶人”,引入Safety Case机制。L3重点规范人机交接,L4强调自身风险处置、不得依赖远程协助。新申请车型实施日起执行,已获批车型有约一年过渡期。 具身智能 政策/监管 推荐理由: 首部 L3/L4 强制国标公示,意味着自动驾驶从推荐性标准升级为强制性安全底线,车企靠模糊宣传抢市场的阶段正式结束,行业竞争逻辑从此由功能展示转向安全实证。 23:05 OpenAI:官网动态(RSS · 排除企业/客户案例) 精选 72 OpenAI与哈佛等合作研究:o3 Deep Research模型辅助诊断儿童罕见病,额外诊断率4.8% 波士顿儿童医院、哈佛大学与OpenAI合作,在《NEJM AI》发表研究。团队使用OpenAI o3 Deep Research推理模型重新分析376例此前未确诊的罕见病案例,产出基于证据的候选解释。经专家评审、额外检测和临床确认,医生在18例中建立诊断,额外诊断率达4.8%。研究显示,AI辅助工作流可帮助专家在未解病例中生成可检验假设,使定期再分析更具可扩展性。模型不直接诊断或做临床决策,仅提供证据链供专家审查。 OpenAI 推理 数据/训练 论文/研究 推荐理由: 这是AI辅助罕见病诊断的严肃实证,4.8%的新诊断率在专家反复分析过的病例里相当扎实。虽然离临床落地还很

Hugging Face 教程/实践 数据/训练 具身智能 政策/监管 OpenAI 推理 论文/研究 智能体 开源/仓库 产品更新 多模态 DeepMind 安全/对齐 部署/工程 现象/趋势 行业动态 图像生成 模型发布 语音 MCP/工具 DeepSeek 开源生态 arXiv 编码 Google
AI HOT ·

我国首部L3/L4自动驾驶强制性国标公示:2027年7月起实施

23:14 IT之家(RSS) 精选 76 工信部6月16日就《智能网联汽车自动驾驶系统安全要求》等2项强制性国标公开征求意见,公示至6月24日,建议2027年7月1日起实施。该标准系我国首部针对L3/L4的强制性国标,要求系统安全水平至少达到“合格且专注驾驶人”,引入Safety Case机制。L3重点规范人机交接,L4强调自身风险处置、不得依赖远程协助。新申请车型实施日起执行,已获批车型有约一年过渡期。 具身智能 政策/监管 推荐理由: 首部 L3/L4 强制国标公示,意味着自动驾驶从推荐性标准升级为强制性安全底线,车企靠模糊宣传抢市场的阶段正式结束,行业竞争逻辑从此由功能展示转向安全实证。

具身智能 政策/监管
AI HOT ·

AI 智能体够格吗?在自有工具上评测开源模型

21:47 Hugging Face:Blog(RSS) 精选 74 Hugging Face 发布面向 AI 智能体使用场景的基准测试框架,以 transformers 库为案例评估库的智能体友好度。框架使用 pi coding agent 与开源模型驱动,通过 Hugging Face Jobs 分散任务确保硬件一致。评估关注 agent 完成任务的成本、延迟、token 使用量和失败率,而非仅最终结果。此前 hf CLI 经优化后 agent token 使用量减少 1.3-1.8 倍(最高 6 倍),该框架旨在验证类似优化对 transformers 的效果。 智能体 Hugging Face 开源/仓库 教程/实践 推荐理由: Hugging Face 这波实验打破了我的直觉——为大型模型优化的 CLI+Skill 方案反而让小模型正确率暴跌,做 agent 工具链的人应该马上看这个标杆。

智能体 Hugging Face 开源/仓库 教程/实践
AI HOT ·

OpenAI与哈佛等合作研究:o3 Deep Research模型辅助诊断儿童罕见病,额外诊断率4.8%

23:05 OpenAI:官网动态(RSS · 排除企业/客户案例) 精选 72 波士顿儿童医院、哈佛大学与OpenAI合作,在《NEJM AI》发表研究。团队使用OpenAI o3 Deep Research推理模型重新分析376例此前未确诊的罕见病案例,产出基于证据的候选解释。经专家评审、额外检测和临床确认,医生在18例中建立诊断,额外诊断率达4.8%。研究显示,AI辅助工作流可帮助专家在未解病例中生成可检验假设,使定期再分析更具可扩展性。模型不直接诊断或做临床决策,仅提供证据链供专家审查。 OpenAI 推理 数据/训练 论文/研究 推荐理由: 这是AI辅助罕见病诊断的严肃实证,4.8%的新诊断率在专家反复分析过的病例里相当扎实。虽然离临床落地还很远,但证明推理模型能帮专家从旧数据里挖出新线索。

OpenAI 推理 数据/训练 论文/研究
AI HOT ·

Adobe 为 Photoshop、Premiere 等多款 Creative Cloud 应用加入 AI 智能体

21:21 The Decoder:AI News(RSS) 精选 72 Adobe 将其“创意智能体”扩展至 Photoshop、Premiere 等应用,以公开测试形式提供 AI Assistant。该智能体可自动完成多步骤常规任务,如 Premiere 分拣素材和粗剪、Photoshop 换背景、Illustrator 批量生成文件、InDesign 更新版式等。Firefly 新增面向个人创作者的品牌套件、产品图转短视频及 Quick Cut 自动剪辑功能。Adobe 工具已集成至 ChatGPT、Claude 及 Microsoft 365 Copilot,Google Gemini 和 Slack 集成即将推出。 智能体 产品更新 多模态 推荐理由: Adobe把AI助手直接塞进了Photoshop、Premiere这些上亿人用的创作工具,干的虽然是粗剪、排版一类的苦力活,但却是AI从生成器转向流程助手的关键一步,值得所有创意工作者上手试试。

智能体 产品更新 多模态
AI HOT ·

OpenAI 升级 ChatGPT 医疗能力:GPT-5.5 Instant 达到 Thinking 模型水平,免费可用

03:23 The Decoder:AI News(RSS) 精选 73 OpenAI 升级 ChatGPT 医疗能力,新模型 GPT-5.5 Instant 在 HealthBench 及 HealthBench Professional 测试中达到最贵 Thinking 模型水平,成本大幅降低。该模型对所有免费用户开放(有使用限制),其回答在准确性、清晰度和完整性上优于医生书写的回答,过去两个月错误健康陈述减少 71%。超 260 名来自 60 个国家的医生审查了 70 多万条模型响应。每周有超 2.3 亿人通过 ChatGPT 咨询健康问题。OpenAI 还提供 ChatGPT for Clinicians 和 OpenAI for Healthcare 等专业工具。 OpenAI 模型发布 推荐理由: ChatGPT 的医疗回答现在比医生写的还好,错误率两个月降了 71%,背后是 260 名医生和 70 万条数据打磨的结果。对 230 million 经常查健康问题的用户,这个升级每天都会用得上。

OpenAI 模型发布
AI HOT ·

DeepSeek 识图模式正式上线 App 和网页端

16:14 IT之家(RSS) 精选 72 DeepSeek 识图模式于6月18日在网页和 App 端正式上线,与快速模式、专家模式并列。开启后用户可直接上传图片让 DeepSeek 识别图像,能力超越简单文字提取。目前 App 端仍显示“图片理解功能内测中”,网页端无此提示。该模式背后的多模态模型技术细节于今年4月公开,核心框架为“Thinking with Visual Primitives(以视觉原语思考)”。 DeepSeek 产品更新 多模态 推荐理由: DeepSeek的识图模式终于从内测进了正式版,虽然是补课而非破圈,但对中文用户来说,让AI直接看图比打字描述常用太多,日常工作和内容处理都更顺手了。

DeepSeek 产品更新 多模态
AI HOT ·

Kimi Work 新增目标模式与插件中心,6月推出额度消耗5折福利

17:10 公众号:月之暗面(Kimi) 精选 70 月之暗面旗下 Kimi Work(Beta 版)新增「目标模式」,支持设定终点后由 Agent 自主循环推进任务,最长连续运行24小时,过程中人类可随时中断调整。同时上线「插件中心」,可选装百度网盘、Canva可画、钉钉、飞书、WPS、Notion、Cloudflare 等外部应用。6月限时福利期间,Kimi 电脑客户端 Work 模式所有任务会员额度消耗减半,即从0.02%降至0.01%。 智能体 MCP/工具 产品更新 推荐理由: 目标模式把 Kimi Work 从对话助手变成了能连续运行 24 小时的自主 Agent,配合插件中心打通办公软件,对需要长时间执行复杂任务的用户是实际可用性的大升级。

智能体 MCP/工具 产品更新