AI and technology watch

AI 新闻

聚合过去 24 小时 AI 与开发者生态动态,并提供来源链接以便深入阅读。

---
AI HOT ·

随着智能体应用迈向更大规模部署,其背后的云技术栈也需同步扩展。 在百度Create大会上,百度集团执行副总裁、百度智能云事业群总裁沈抖宣布推出专为大规模智能体应用打造的全新全栈AI云,其升级涵盖智能体基础设施与AI基础设施。 基于我们自研的昆仑芯AI芯片构建的专用集群,已支持ERNIE 5.1系列中一个关键模型的训练。

22:29 Baidu Inc. @ Baidu_Inc 精选 61 智能体 产品更新 部署/工程 推荐理由: 百度云这次升级把 agent 部署的算力调度和芯片层都打通了,昆仑芯能跑文心 5.1 是个信号,国内做 agent 的团队可以看看底层成本是否真有优势。

智能体 产品更新 部署/工程
AI HOT ·

官宣:ChatGPT手机应用现已集成Codex!!太棒了 Codex真是强大。我太喜欢了。

04:32 Chubby♨️ @ kimmonismus 精选 74 智能体 OpenAI 产品更新 编码 推荐理由: Codex 终于登陆 ChatGPT 移动端,用手机就能启动和查看 Agent 编码进度,对移动端开发者非常友好,也标志着 AI 编码真正从桌面走向全场景。 04:09 OpenAI:官网动态(RSS · 排除企业/客户案例) 精选 78 随时随地使用 Codex 用户现可通过 ChatGPT 移动应用随时随地使用 Codex。该功能支持跨设备和远程环境实时监控、引导及批准编码任务,实现了对编程工作的无缝移动端管理。 智能体 OpenAI 产品更新 编码 关联讨论 2 条 X:OpenAI Developers (@OpenAIDevs) X:OpenAI (@OpenAI) 推荐理由: Codex mobile让你在手机上监控和指挥AI写代码,对需要远程协作的开发者是个实用升级,不过更像功能补全而非颠覆性创新,适合日常需要随时掌控进度的团队。 03:45 Hugging Face:Blog(RSS) 精选 73 Granite Embedding Multilingual R2:开源多语言嵌入模型,具备32K上下文与领先检索性能 IBM Granite团队在Hugging Face发布了Granite Embedding Multilingual R2多语言文本嵌入模型。该模型采用Apache 2.0开源协议,上下文长度扩展至32K令牌,参数量低于1亿。在MTEB基准的检索评估中,它取得了同规模模型的最佳性能,尤其擅长多语言混合检索,为开发者提供了高效、轻量且可商用的嵌入解决方案。 开源生态 模型发布 推荐理由: IBM这个嵌入模型把100M以下参数级别的检索质量推到了新SOTA,Apache 2.0开源,做RAG的可以直接拿来替换老旧底座了。 03:18 Tomer Tunguz 博客(VC 分析) 精选 65 AI电子邮件的成本分析 使用顶尖AI模型处理邮件的月度成本约为22至130美元,中位数26美元。若软件公司以75%毛利率定价,年费可能高达350美元,加上托管服务后标价或达500美元,约为Google企业邮箱费用的两倍。采用小型模型可降低成本10至20倍,而通过本地运行利用用户GPU,更能将成本削减至接近零。结合基础启发式方法和技术优化,总成本有望降低100倍。这种针对不同工作负载匹配模型并进行成本分层的推理市场细分,将是未来一两年AI软件发展的关键。 推理 现象/趋势 部署/工程 推荐理由: Tunguz 给 AI 邮件算了一笔账,SOTA 模型月费 22-130 美元,但他更重要的判断是推理分割可以把成本压到百分之一,这对做 AI 软件的定价逻辑是个关键风向。 03:01 xAI:News(网页) 精选 73 xAI 推出

智能体 OpenAI 产品更新 编码 开源生态 模型发布 推理 现象/趋势 部署/工程 xAI Anthropic 安全/对齐 政策/监管 数据/训练 行业动态 MCP/工具 教程/实践
AI HOT ·

克劳德代码与《代码书》技能:有针对性的技能培养

21:29 Hacker News 热门(buzzing.cc 中文翻译) 精选 78 开发者发布了一款名为“克劳德代码与《代码书》技能”的GitHub工具,旨在通过刻意练习提升编程技能。该工具利用AI模型生成特定主题的代码示例与解释,帮助用户进行针对性学习。项目在Hacker News上获得104点热度,关注度较高。其核心变化在于将传统的广泛学习转化为聚焦、可重复的技能训练模式,通过结构化练习提升学习效率。 教程/实践 编码 推荐理由: 这个skill把Claude Code变成一对一的代码教练,专门抓你代码里的坏习惯,对想用AI真正提升编码水平的人是个好东西。

教程/实践 编码
AI HOT ·

AI 热潮引发民怨:七成美国民众反对家门口建数据中心

20:40 IT之家(RSS) 精选 70 盖洛普调查显示,高达七成美国民众反对在住宅附近建设数据中心,反对率较去年大幅上升,抵触情绪甚至超过对核电站的接受度。全美已有69个辖区出台暂停令,多地项目因抗议和监管纠纷延期。数据中心建设推高批发电价,导致用电成本激增,并引发空气污染、水资源消耗等担忧。尽管白宫要求AI企业承担配套成本,但仅为无约束力承诺,未来审批将更严苛。 政策/监管 行业动态 推荐理由: AI 数据中心的邻避效应正升级为政治暴力,电价暴涨 267% 是民怨的导火索,做基础设施的不能只算经济账了。

政策/监管 行业动态
AI HOT ·

认识Kimi网页桥接--Kimi的浏览器扩展。 现在智能体可以像人类一样与网站互动:搜索、滚动、点击、输入并完成任务。 支持Kimi Code CLI、Claude Code、Cursor、Codex、Hermes等平台。 现已在http://kimi.com/features/webbridge和Chrome应用商店上线。

21:45 Kimi.ai @ Kimi_Moonshot 精选 80 智能体 产品更新 关联讨论 3 条 X:Berry Xia (@berryxia) X:邵猛 (@shao__meng) X:Testing Catalog (@testingcatalog) 推荐理由: 这是Kimi给Agent加的'手',直接操作网页,支持主流CLI,对做网页自动化的开发者多了一个选择,即装即用挺方便。

智能体 产品更新
AI HOT ·

由联合创始人兼首席科学家李沐博士领导的团队发布了SenseNova U1技术报告,详细阐述了其架构、训练方案与创新突破。此次开源同步发布了基于混合专家模型(MoE)的新权重,旨在推动AI领域的透明度、可复现性与进一步创新。团队希望通过开放共享促进整个社区的技术发展。

19:15 SenseTime @ SenseTime_AI 精选 77 开源/仓库 开源生态 数据/训练 模型发布 推荐理由: 商汤这次把SenseNova U1的MoE权重和完整技术报告一起开源,比常规PR多了些诚意,做模型选型和微调的值得翻翻。

开源/仓库 开源生态 数据/训练 模型发布
AI HOT ·

OpenAI遭集体诉讼,被指通过追踪代码向Meta等泄露用户查询隐私

17:40 AYi @ AYi_AInotes 精选 75 南加州联邦法院已受理针对OpenAI的集体诉讼,指控其在ChatGPT网站中嵌入Facebook Pixel等代码,侵犯用户隐私。当用户提交查询时,查询主题会作为浏览器标题与含Facebook唯一ID的cookies一并实时发送给Meta。OpenAI虽称仅分享“有限标识符”用于广告,但原告认为查询主题本身即高度敏感的个人信息。此案揭示免费AI服务的潜在代价:用户每一次查询及数字身份可能成为被交易的产品,与许多用户为逃避追踪而选择ChatGPT的初衷形成讽刺对比。 OpenAI 数据/训练 行业动态 推荐理由: 免费AI的代价一向是数据训练,但OpenAI这次被诉把用户每次查询实时推给Meta和Google,隐私暴露比想象中严重得多,值得所有ChatGPT用户警惕。

OpenAI 数据/训练 行业动态
AI HOT ·

我们发表了一篇阐述中美人工智能竞争观点的论文。 当前美国及其民主盟友在前沿AI领域保持领先。了解如何维持这种优势的更多内容:https://www.anthropic.com/research/2028-ai-leadership

02:10 Anthropic @ AnthropicAI 精选 75 Anthropic 政策/监管 现象/趋势 推荐理由: Anthropic 第一次把中美 AI 竞争立场写成正式论文,不是模糊的公关话,政策研究者和出海企业该认真读。 02:08 凡人小北 @ frxiaobei 精选 80 OpenEvidence覆盖65%美国医生,shadow AI模式引关注 OpenEvidence已覆盖65%的美国医生,4月单月临床场景使用达2700万次,平均每位医生每月使用41次。平台由医生个人通过执业编号在手机上注册,医院最初不知情,Mount Sinai的AI负责人称此为shadow AI,表示其早在基层普及。医院后来才追签企业合作,OpenEvidence强调这是美国医疗史上首次让大多数医生自愿采用单一技术平台的突破。合作伙伴包括NEJM、JAMA、NCCN和Wiley,为此提供了支持。 行业动态 推荐理由: 65%的美国医生自发用上的AI工具,这才是真正的渗透率。做垂直SaaS和AI应用的人都该学学,不是靠医院采购,而是靠医生自己装手机上——冰山下全铺开了。 02:00 Claude:Blog(网页) 精选 73 在大型代码库中高效运用Claude Code:最佳实践与入门指南 Claude Code已成功部署于数百万行的单体仓库、遗留系统及分布式架构中。其核心在于围绕模型构建的“工具套件”,而非仅依赖模型本身。该套件包含五个关键扩展点:提供代码库概览的CLAUDE.md文件、实现持续改进的钩子、按需加载专业知识的技能、插件以及MCP服务器。它采用智能体搜索模式,直接在开发者本地实时代码库上操作,无需构建和维护集中式索引,从而避免了传统RAG系统在活跃大型代码库中索引过时的问题。团队对代码库设置的投入程度直接决定了其导航效果。 智能体 Anthropic MCP/工具 教程/实践 推荐理由: 这是 Anthropic 官方出的 Claude Code 大型代码库配置指南,把 CLAUDE.md、hooks、skills 的层级和分工讲得比社区经验更系统,做工程落地的团队可以当作部署手册。 02:00 Claude:Blog(网页) 精选 74 创始人手册:构建AI原生初创公司 Anthropic公司发布了一份面向AI原生初创企业的实用指南,旨在重塑2026年创业生命周期的构思、最小可行产品、发布和规模化四个核心阶段。该手册为每个阶段提供了具体目标、退出标准、常见失败模式及AI驱动练习,涵盖如何利用Claude进行问题验证与客户发现、避免AI生成代码的技术债务、区分真实产品市场契合度与早期炒作,并引入智能工作流替代创始人手动操作。指南还整合了多家初创企业的实践案例,为从零开始围绕AI构建公司的创始人提供架构、范围与安全方面的最佳实践。 智能体 Anth

Anthropic 政策/监管 现象/趋势 行业动态 智能体 MCP/工具 教程/实践 编码 Google 产品更新 部署/工程 图像生成 端侧
AI HOT ·

MiMo V2.5 Pro 在 @DesignArena 上刚刚获得第三名!🎉 MiMo V2.5 Pro (Thinking) 在总排行榜上比 MiMo-V2.5 提升了 8 个名次,在前端编码任务中达到与 Claude Sonnet 4.6 相同的性能水平。 衷心祝贺 @XiaomiMiMo 团队取得这些进步!

13:58 Xiaomi MiMo @ XiaomiMiMo 精选 69 开源生态 编码 评测/基准 关联讨论 1 条 X:小米 MiMo (@XiaomiMiMo) 推荐理由: 小米MiMo在Design Arena前端编码评测里直接杀进前三,跟Claude Sonnet 4.6平起平坐,这是国产开源模型在代码能力上第一次给我真正的压迫感,搞前端的可以盯一下。

开源生态 编码 评测/基准
AI HOT ·

"让 Token 消耗降低 61%":腾讯开源 Agent Memory

15:40 IT之家(RSS) 精选 74 腾讯云开源了TencentDB Agent Memory,旨在解决Agent长任务中上下文窗口易满、Token成本高的问题。该方案采用“上下文卸载”与“Mermaid任务画布”两项核心技术,将完整信息卸载至外部存储,同时用结构化任务图保留关键状态与执行路径。实验显示,该方案在多任务连续会话中最高可降低61%的Token消耗,并提升任务成功率。项目已适配OpenClaw等主流框架,支持一键集成与本地SQLite存储。 智能体 MCP/工具 开源/仓库 推荐理由: 腾讯开源的这个 Agent Memory,用 Mermaid 画布加上下文卸载,把长任务 Token 省了 61%,而且所有中间信息都可追溯,做复杂 Agent 的开发者可以直接抄作业了。

智能体 MCP/工具 开源/仓库
AI HOT ·

百度推进智能体组合以拥抱智能体时代,主张将日活跃智能体作为关键指标 https://www.prnewswire.com/news-releases/baidu-advances-agent-portfolio-to-embrace-the-agent-era-champions-daily-active-agents-as-key-metric-302771383.html

14:59 Baidu Inc. @ Baidu_Inc 精选 73 智能体 行业动态 推荐理由: 百度把Agent推到战略高度还提出日活Agent新指标,做企业市场的可以盯着看怎么落地,但官方公告水分不小先观望。

智能体 行业动态
AI HOT ·

编写了一个技能,可以循环运行codex /review直到没有错误为止。 注意事项:它不会为你修复系统架构,所以你仍然需要将BRAIN作为主模型。https://github.com/steipete/agent-scripts/blob/main/skills/codex-review/SKILL.md

17:05 Peter Steinberger 🦞 @ steipete 精选 70 智能体 教程/实践 编码 推荐理由: 这种让 AI 反复 review 直到满意的脚本,看似简单但切中痛点——代码审查不再是一锤子买卖。做 AI coding 的值得抄进自己的 workflow。

智能体 教程/实践 编码
AI HOT ·

检索廉价,代码为王:基于可执行程序的多跳推理检索增强生成

12:45 HuggingFace Daily Papers(社区热门论文) 精选 71 针对多跳检索增强生成(RAG)中推理过程隐式、检索漂移及错误难以自查的问题,研究团队提出PyRAG框架,将多跳推理任务重构为程序合成与执行过程。该框架将推理步骤编写为可执行的Python程序,通过显式调用检索与问答工具实现多步计算,使中间状态变量化、反馈确定化,并生成完整可检查的推理轨迹。该方法无需额外训练即可支持基于编译器的自我修复与执行驱动的自适应检索。在PopQA、HotpotQA等五个问答基准测试中,PyRAG在无需训练和强化学习训练两种设定下均显著优于基线模型,尤其在组合式多跳数据集上提升显著。相关资源已开源。 检索增强 论文/研究 推荐理由: 把多跳RAG变成可执行的Python程序,中间状态全透明,实验在五个数据集上都压住了基线,做检索增强的值得看一眼。

检索增强 论文/研究
AI HOT ·

OpenAI 回应 TanStack npm 供应链攻击并加强安全措施

12:50 OpenAI:官网动态(RSS · 排除企业/客户案例) 精选 68 OpenAI 针对 TanStack “Mini Shai-Hulud” npm 供应链攻击事件作出响应。攻击者通过维护者账户发布了恶意伪造包。OpenAI 确认内部系统未受影响,但为防范风险,已撤销并重签所有相关代码签名证书,并要求 macOS 用户在 2026 年 6 月 12 日前更新应用。公司同时加强了第三方依赖审查和自动化安全监控,以提升软件供应链安全防御。 OpenAI 行业动态 关联讨论 2 条 X:阿易 AI Notes (@AYi_AInotes) IT之家(RSS) 推荐理由: OpenAI第一次公开回应供应链攻击,不仅解释了影响范围,还给出了硬性的6月12日更新死线,macOS用户最好现在就去检查版本。

OpenAI 行业动态
AI HOT ·

baoyu-skills 新加了一个 Skill: 微信群聊总结 Skill:https://github.com/JimLiu/baoyu-skills/tree/main/skills/baoyu-wechat-summary 依赖于 wx-cli:https://github.com/jackwener/wx-cli 如何配置使用 wx-cli 请看项目文档,无法提供帮助。另外目前只是借助其读取数据,其他没任何关系。 Claude Code + Claude Opus 4.6 效果最佳

12:07 宝玉 @ dotey 精选 80 Anthropic 开源/仓库 教程/实践 关联讨论 1 条 X:Berry Xia (@berryxia) 推荐理由: 微信群聊的AI总结一直缺现成方案,宝玉这个skill直接调wx-cli读取聊天记录再丢给Claude总结,社群运营同学可以马上试试。

Anthropic 开源/仓库 教程/实践
AI HOT ·

UnslothAI发布Qwen3.6 MTP GGUF模型,实现推理速度大幅提升

10:51 Berryxia.AI @ berryxia 精选 79 UnslothAI创始人Daniel Han发布了实验性的Qwen3.6 MTP GGUF模型,显著提升了推理速度。其中,27B模型在单GPU上达到每秒140个token,35B-A3B版本更是高达每秒220个token,相比原版GGUF速度提升超过1.4倍且精度无损。关键优化在于将draft tokens设置为2,这是性能与接受率的最佳平衡点。这项MTP投机解码技术极大提升了消费级显卡运行大模型的效率,推动了本地AI的性能边界。 推理 教程/实践 部署/工程 关联讨论 1 条 X:Rohan Paul (@rohanpaul_ai) 推荐理由: 这波MTP投机解码把消费级显卡的推理速度榨出新高度,27B模型单GPU跑140 tokens/s,精度毫无损失。玩llama.cpp或本地Agent的人现在就该试一下。

推理 教程/实践 部署/工程
AI HOT ·

AgentLens:揭示软件工程智能体评估中的"幸运通过"问题

10:45 HuggingFace Daily Papers(社区热门论文) 精选 70 当前软件工程智能体评估仅依赖最终补丁是否通过测试的二元信号,掩盖了解决方案质量的差异。研究分析了2,614条轨迹,发现在可评估的1,815条通过轨迹中,10.7%属于“幸运通过”,表现为回归循环、盲目重试等问题。为此,研究团队提出了用于过程级评估的AgentLens框架,并发布了标注质量分数、冗余信号等信息的AgentLens-Bench数据集。基于质量分数,通过轨迹被划分为幸运、扎实和理想三个等级,不同模型的幸运通过率介于0.5%至23.2%之间。若按质量分数而非通过率排名,部分模型的排名变化显著。相关资源已开源。 智能体 论文/研究 推荐理由: SWE-agent评估只看通过率太粗暴了,这篇论文把乱试的“幸运通过”和真方案拆开看,10%的通过其实是蒙的,做agent评估的必读。

智能体 论文/研究
AI HOT ·

开源项目OpenSquilla:智能路由与本地检索,大幅降低LLM使用成本

10:56 向阳乔木 @ vista8 精选 72 开源项目OpenSquilla针对大语言模型应用Token消耗过高的问题,提出了智能模型路由与本地向量检索相结合的解决方案。系统能自动判断任务复杂度,将简单问题路由至廉价模型,复杂任务则分配给更强模型,且路由决策在本地完成,不消耗Token。通过增量发送与缓存命中机制,实际传输Token减少了90%以上。其记忆系统能在上下文将满时自动筛选并压缩关键信息,支持混合检索。项目还具备成本统计、安全沙箱、支持OpenClaw一键迁移及定时任务等功能,显著提升了使用效率与经济性。 智能体 开源/仓库 关联讨论 1 条 X:Testing Catalog (@testingcatalog) 推荐理由: 如果你被小龙虾和 Hermes 的 Token 消耗搞得肉疼,OpenSquilla 的智能路由和增量传输直接把成本打下来 90%,还带记忆系统,可以无脑换过去。

智能体 开源/仓库
AI HOT ·

NousResearch发布了Token Superposition Training(TST),这是一种改进标准大语言模型预训练流程的方法。该技术无需改变模型架构、优化器、分词器或训练数据,即可在相同计算量(FLOPs)下实现2-3倍的训练时间加速。其核心是在训练的前三分之一阶段,让模型读取并预测连续的token包,对输入嵌入进行平均,并使用改进的交叉熵损失预测下一个token包;剩余训练时间则恢复为标准的下一个token预测。推理阶段的模型与传统预训练产生的模型完全相同。该方法已在270M、600M、3B的密集模型以及10B至1B的混合专家模型规模上得到验证。

11:14 SiliconFlow @ SiliconFlowAI 精选 73 开源生态 数据/训练 论文/研究 推荐理由: NousResearch的TST训练方法在不改模型架构的情况下把预训练速度提升2-3倍,如果能在工业级规模复现,所有大模型玩家都得重新考虑训练管线。

开源生态 数据/训练 论文/研究