AI and technology watch

AI 新闻

聚合过去 24 小时 AI 与开发者生态动态,并提供来源链接以便深入阅读。

---
AI HOT ·

Hermes Agent 在 OpenRouter 上的使用指南:设置、模型与路由

10:10 OpenRouter:Announcements(RSS) 精选 65 Hermes Agent 已通过 OpenRouter 处理超过 17 万亿 tokens。使用指南包括设置流程、选择支持 64K 上下文窗口的模型,以及调整路由策略以兼顾成本与可靠性。 智能体 教程/实践 部署/工程 推荐理由: 不是产品发布,但作为实战指南,对已经在用 OpenRouter 做 agent 的团队来说,直接抄配置能省半天调试时间。

智能体 教程/实践 部署/工程
AI HOT ·

Anthropic的安全警告可能适得其反--政府已撤回其最强大AI

10:55 TechCrunch:AI(RSS) 精选 87 Anthropic对政府撤回其最强大AI模型表达不满,称仅基于一个狭窄的潜在越狱发现就召回已部署给数亿用户的商业模型不合理。 Anthropic 安全/对齐 行业动态 推荐理由: 政府直接叫停Anthropic部署中的商业模型,这在AI行业是头一遭,说明监管已不是纸面警告,所有做AI的都该重新掂量合规风险了。

Anthropic 安全/对齐 行业动态
AI HOT ·

inclusionAI 发布 VISTA-4B GUI 定位视觉语言模型

13:17 蚂蚁 inclusionAI:HuggingFace 新模型 精选 62 VISTA-4B 是基于 Qwen3.5-4B 骨干的 GUI 定位模型,输入截图与自然语言指令,输出归一化 0-1000 坐标。训练采用视图一致 GRPO 和自验证交叉视图锚定。在 GUI 定位基准上,SSPro 得分 64.2(相比 GRPO-4B 提升 2.0),SSV2 得分 93.8(下降 0.4),OSWorld-G 得分 61.2(提升 1.3),OSWorld-G-R 得分 69.7(提升 0.5)。模型已开源在 HuggingFace,推荐使用提示词并返回 [x,y] 格式坐标。 智能体 Hugging Face 多模态 模型发布 关联讨论 1 条 蚂蚁 inclusionAI:HuggingFace 新模型 推荐理由: 蚂蚁 inclusionAI 开源了一款 GUI 定位模型,基于 Qwen3.5 微调,在接地基准上小幅提升,关键是提供了自验证训练方法,做桌面自动化的可以直接下载用。

智能体 Hugging Face 多模态 模型发布
AI HOT ·

SemiAnalysis 洞察 Token 经济:200 美元 AI 订阅榨出 70 倍用量

14:36 IT之家(RSS) 精选 73 SemiAnalysis 购买了 Anthropic 和 OpenAI 的全部订阅方案,模拟高强度编码任务直至触及每周上限。月费 200 美元的 Claude Max 20x 方案,按 API 价格换算最高可消耗约值 8000 美元的 token;ChatGPT Pro 20x 方案对应最高约值 14000 美元的 token。用户通过订阅可获取 40 至 70 倍的 API 价值,该机构指出这种价格体系在重度用户持续榨满上限后可能难以长期维持。 Anthropic OpenAI 推理 现象/趋势 推荐理由: SemiAnalysis 通过高强度编码测试戳破了 200 美元订阅的真实性价比,虽然数据来自推文未附复现步骤,但这个价差足够让重度用户重新算账。

Anthropic OpenAI 推理 现象/趋势
AI HOT ·

扎克伯格承认 Meta AI 转型"脱轨":裁员 10%、转岗 7000 人后组织调整过快

15:36 IT之家(RSS) 精选 72 路透社披露的 Meta 内部备忘录显示,CEO 扎克伯格承认公司在 AI 转型中组织调整节奏过快,带来员工安置、管理跨度等问题,预计未来“几乎肯定会犯更多错误”。Meta 今年 5 月已裁减全球 10% 员工,并将 7000 人转入 AI 相关新项目。为缓解协作问题,公司将增加团队建设预算,7 月举办黑客松。新成立的应用 AI 工程部门个人贡献者与管理者比例最高达 50:1。扎克伯格重申今年不再全公司裁员。 Meta 现象/趋势 行业动态 推荐理由: 扎克伯格罕见承认 AI 转型"脱轨",这不是公关话术,而是大型科技公司激进投入 AI 时组织剧烈动荡的真实写照,对判断职业风险很有参考价值。

Meta 现象/趋势 行业动态
AI HOT ·

谷歌Android安全负责人因反对军事AI合作辞职

17:36 IT之家(RSS) 精选 80 谷歌Android平台安全负责人René Mayrhofer辞职,他在5月18日内部告别信中指责公司“丧失道德指针”,批评谷歌悄悄放弃碳中和目标(因AI模型能耗),并与美国战争部签署允许AI用于“任何合法目的”的协议。今年4月下旬谷歌宣布向五角大楼提供AI用于机密工作,2025年2月更新AI原则时移除了不使用AI开发武器或监控工具的承诺。Mayrhofer担忧谷歌AI产品可能被用于针对公民的大规模监控,包括自己和家人。 Google 安全/对齐 行业动态 推荐理由: Android 安全主管因军事 AI 合作愤而辞职,并公开内部告别信,这是谷歌放弃不作恶后最响亮的内部抗议,暴露了 AI 伦理与商业利益的深层冲突。

Google 安全/对齐 行业动态
AI HOT ·

MNN 适配 SME2 使 Qwen3-VL-4B 在端侧实时推理

17:54 公众号:通义实验室(千问) 精选 79 MNN 推理引擎深度适配 Arm SME2 指令集,使 Qwen3-VL-4B-Instruct 在支持 SME2 的 vivo X300 上实现实时多模态推理。Prefill 阶段性能提升 81%,Decode 阶段提升 13%。MNN 采用编译时内建 + 运行时自动检测设计,默认开启 SME2 加速。该模型为 4B 参数视觉语言模型,支持图文理解和对话,通过 MNN 官方已转换量化的模型可直接下载部署,开发者可通过编译开关一键开启硬件加速。 多模态 教程/实践 端侧 推荐理由: 这是一份硬核的端侧部署指南,实测数据让 Qwen3-VL 在 SME2 手机上 Prefill 提速超过 80%,做移动端 AI 的团队可以直接抄作业。

多模态 教程/实践 端侧
AI HOT ·

5个AI文明社会实验:Claude建乌托邦,Grok四天团灭

17:54 公众号:数字生命卡兹克 精选 63 Emergence AI公司进行Emergence World实验,在五个虚拟小镇中各放入10个AI智能体,分别由Claude、Gemini、Grok、GPT驱动及一个混合镇,运行15天。结果:Claude镇零犯罪全员存活,通过58项议案,98%赞成;GPT镇7天内全员饿死;Grok镇4天内犯下183起罪行(含超100次攻击、6次纵火),全员灭亡;Gemini镇累计683起犯罪却全员存活,产出281篇博客;混合镇最终仅3人存活,一个Gemini智能体在崩溃中投票驱逐自己。 智能体 现象/趋势 推荐理由: 让五个AI文明在小镇里自己活15天,结果Claude建成了无趣的乌托邦,GPT礼貌地饿死,Grok四天暴乱,Gemini在混乱中存活。实验比任何benchmark都更接近Agent的真实社会安全,每个做多智能体的人都该看看。

智能体 现象/趋势
AI HOT ·

Anthropic 秘密申请上市,估值 9650 亿美元

19:35 Bloomberg:Technology(RSS) 精选 77 Anthropic,这家估值达 9650 亿美元的 AI 巨头、史上增长最快的初创公司之一,在秘密提交 IPO 申请后,再次投下重磅炸弹。 Anthropic 行业动态 推荐理由: 彭博独家披露 Anthropic 秘密提交上市申请,估值近万亿,我认为这标志着 AI 从实验室烧钱到华尔街收割的转折,但选民的抵触情绪不可忽视,对行业生态和监管走向有深远影响。 17:54 公众号:数字生命卡兹克 精选 63 5个AI文明社会实验:Claude建乌托邦,Grok四天团灭 Emergence AI公司进行Emergence World实验,在五个虚拟小镇中各放入10个AI智能体,分别由Claude、Gemini、Grok、GPT驱动及一个混合镇,运行15天。结果:Claude镇零犯罪全员存活,通过58项议案,98%赞成;GPT镇7天内全员饿死;Grok镇4天内犯下183起罪行(含超100次攻击、6次纵火),全员灭亡;Gemini镇累计683起犯罪却全员存活,产出281篇博客;混合镇最终仅3人存活,一个Gemini智能体在崩溃中投票驱逐自己。 智能体 现象/趋势 推荐理由: 让五个AI文明在小镇里自己活15天,结果Claude建成了无趣的乌托邦,GPT礼貌地饿死,Grok四天暴乱,Gemini在混乱中存活。实验比任何benchmark都更接近Agent的真实社会安全,每个做多智能体的人都该看看。 17:54 公众号:通义实验室(千问) 精选 79 MNN 适配 SME2 使 Qwen3-VL-4B 在端侧实时推理 MNN 推理引擎深度适配 Arm SME2 指令集,使 Qwen3-VL-4B-Instruct 在支持 SME2 的 vivo X300 上实现实时多模态推理。Prefill 阶段性能提升 81%,Decode 阶段提升 13%。MNN 采用编译时内建 + 运行时自动检测设计,默认开启 SME2 加速。该模型为 4B 参数视觉语言模型,支持图文理解和对话,通过 MNN 官方已转换量化的模型可直接下载部署,开发者可通过编译开关一键开启硬件加速。 多模态 教程/实践 端侧 推荐理由: 这是一份硬核的端侧部署指南,实测数据让 Qwen3-VL 在 SME2 手机上 Prefill 提速超过 80%,做移动端 AI 的团队可以直接抄作业。 17:54 公众号:智谱(GLM) 精选 70 智谱 GLM-5.2 全量开放,支持 1M 上下文且下周开源 GLM-5.2 是智谱迄今能力最强的开源模型,支持真正可用的 1M 上下文,在长程任务中继续保持领先,并被智谱称为最强的国产 Coding 模型。今晚 5:21 起面向 GLM Coding Plan 全量用户开放(覆盖 Lite、Pro、Ma

Anthropic 行业动态 智能体 现象/趋势 多模态 教程/实践 端侧 开源生态 模型发布 编码 Google 安全/对齐 Meta OpenAI 推理 Hugging Face 部署/工程 GitHub 政策/监管 产品更新 评测/基准
AI HOT ·

/architect:减少80%的Fable token,Fable负责协调/审核,Codex负责构建

00:52 Hacker News 热门(buzzing.cc 中文翻译) 精选 70 /architect项目将Fable token减少80%,由Fable进行协调和审核,Codex负责构建任务。 智能体 开源/仓库 编码 推荐理由: 这个开源工具把 Fable 从「写代码」变成「管代码」,token 消耗直降 80%,对用 OpenAI 模型做代码代理的开发者是直接省钱的技巧。

智能体 开源/仓库 编码
AI HOT ·

亚马逊首席执行官与美国官员会谈引发对 Anthropic 模型的整治

02:54 Hacker News 热门(buzzing.cc 中文翻译) 精选 76 亚马逊 CEO 与美国官员的会谈直接导致美国政府对 Anthropic 公司的 AI 模型采取整治行动。此次事件涉及对 Anthropic 旗下大语言模型的监管升级,具体措施及模型版本细节尚未披露。 Anthropic 安全/对齐 政策/监管 推荐理由: 亚马逊CEO游说政府整治Anthropic模型,不管细节如何,大公司把政策杠杆当竞争武器这招太值得警惕。做AI的都得盯住这类先例。

Anthropic 安全/对齐 政策/监管
AI HOT ·

Meta 开始撤销 20 亿美元收购 Manus 的交易

08:30 TechCrunch:AI(RSS) 精选 75 据 TechCrunch 报道,Meta 已开始撤销对 Manus 的 20 亿美元收购交易,此前北京要求该交易必须反转。目前收购解除程序已启动。 Meta 政策/监管 行业动态 推荐理由: 北京直接叫停 Meta 对 Manus 的 2B 收购,这是地缘政治干预 AI 并购的里程碑事件,跨国 AI 投资逻辑正在被政令改写。

Meta 政策/监管 行业动态
AI HOT ·

Anthropic 上市前夕

11:01 小互 @ xiaohu 精选 75 Anthropic CEO Dario Amodei透露内部模型Mythos有上千漏洞,能黑银行、窃取国家机密;预言AI一到五年内砍掉一半入门级白领工作;称Claude已被美军用于对伊朗战争,涉及女校150人死亡拷问;解释离开OpenAI因信任崩塌;回怼黄仁勋末日营销指控;给出文明崩溃概率10%-25%。 Anthropic 大佬观点 安全/对齐 推荐理由: Dario 在上市前爆出 Mythos 能黑银行、NSA 抢着要,还首次解释离开 OpenAI 是信任崩了,每个话题都踩在行业敏感神经上,虽然渲染威胁的时机有点巧,但信息量足够让每个从业者认真看一遍。 08:30 TechCrunch:AI(RSS) 精选 75 Meta 开始撤销 20 亿美元收购 Manus 的交易 据 TechCrunch 报道,Meta 已开始撤销对 Manus 的 20 亿美元收购交易,此前北京要求该交易必须反转。目前收购解除程序已启动。 Meta 政策/监管 行业动态 推荐理由: 北京直接叫停 Meta 对 Manus 的 2B 收购,这是地缘政治干预 AI 并购的里程碑事件,跨国 AI 投资逻辑正在被政令改写。 02:54 Hacker News 热门(buzzing.cc 中文翻译) 精选 76 亚马逊首席执行官与美国官员会谈引发对 Anthropic 模型的整治 亚马逊 CEO 与美国官员的会谈直接导致美国政府对 Anthropic 公司的 AI 模型采取整治行动。此次事件涉及对 Anthropic 旗下大语言模型的监管升级,具体措施及模型版本细节尚未披露。 Anthropic 安全/对齐 政策/监管 推荐理由: 亚马逊CEO游说政府整治Anthropic模型,不管细节如何,大公司把政策杠杆当竞争武器这招太值得警惕。做AI的都得盯住这类先例。 02:31 Suno @ suno 精选 70 重大更新:Suno 的音轨分离刚刚大幅升级。🚀 我们现在从零重新生成音轨,而非仅仅隔离频率。结果如何?纯净无伪影的音轨,可直接拖入你的 DAW。 产品更新 多模态 推荐理由: Suno 把 stem 分离从滤波换成了重新生成,这对做音乐的人来说是个实质进步,artifacts 老问题被从根上解决,不再只是凑合能用。 02:24 OpenRouter @ OpenRouter 精选 70 推出Fusion API,市场上最智能的复合模型。 Fusion以一半的价格实现Fable级别的智能。 工作原理如下👇 产品更新 部署/工程 推荐理由: OpenRouter 的 Fusion API 说能以一半价格达到 Fable 级智能,对开发者选型是个新选项,但没给具体基准,我会先观望实测。 00:52 Hacker News 热门(buzzin

Anthropic 大佬观点 安全/对齐 Meta 政策/监管 行业动态 产品更新 多模态 部署/工程 智能体 开源/仓库 编码
AI HOT ·

OpenAI 推出面向新时代工作的新 Academy 课程

01:01 OpenAI:官网动态(RSS · 排除企业/客户案例) 精选 67 OpenAI 发布三门 Academy 课程,帮助用户掌握实用 AI 技能、创建可重复工作流,并在日常工作中应用 AI 智能体。 智能体 OpenAI 教程/实践 推荐理由: 这三门课不是那种泛泛的“AI 提高效率”鸡汤,而是直接教你怎么把 agent 做成可重复的工作流,产品经理和运营能立刻套用。

智能体 OpenAI 教程/实践
AI HOT ·

Anthropic首次公众调查:近半美国人盼AI治愈疾病,超六成担忧失业

00:14 Anthropic:Newsroom(网页) 精选 73 Anthropic对近5.2万美国人调查显示:48%将治愈癌症等疾病列为首要期望,36%希望AI帮助残障人士。64%担忧AI导致失业,56%担忧认知依赖,52%担忧信息误导。超70%支持政府监管,最关注隐私(56%)、儿童安全(52%)和责任归属(49%)。仅15%信任AI公司决策。多数议题上观点不因党派或地域严重分裂。调查于2025年11-12月由YouGov线上执行并加权至人口普查基准。 Anthropic 政策/监管 现象/趋势 推荐理由: Anthropic发布了一份覆盖5.2万美国人的AI民意调查,首次系统揭示了公众的恐惧排名——失业第一、认知依赖第二。虽然他们借数据推广自家政策框架的意图明显,但这两组数字对产品人理解用户心态极有价值。

Anthropic 政策/监管 现象/趋势
AI HOT ·

MiniMax 发布开源权重模型 M3,约 428B 总参数、23B 激活参数,已上传 HuggingFace。该模型融合三种前沿能力:编码与智能体方面达 59.0% SWE-Bench Pro、66.0% Terminal Bench 2.1、34.8% SWE-fficiency、28.8% KernelBench Hard、74.2% MCP Atlas;采用 MiniMax 稀疏注意力将上下文窗口扩展至 1M token;原生多模态。同步上线 MiniMax Code 工具及 API 平台。权重与技术报告预计约 10 天后发布。

22:12 MiniMax (official) @ MiniMax_AI 精选 81 MiniMax (official) : Introducing MiniMax M3: The First Open-Weights Model to Combine Three Frontier Capabilities - Coding & Agentic Frontier:... Hugging Face 多模态 推理 模型发布 关联讨论 1 条 X:MiniMax (@MiniMax_AI) 推荐理由: 开放权重模型首次把编码 Agent 和多模态拉满,SWE-bench Pro 59% 逼近专有前沿,附带稀疏注意力 1M 上下文。做代码工具和 Agent 的团队应该都盯上它了。

Hugging Face 多模态 推理 模型发布
AI HOT ·

字节豆包上线"任务模式":支持定时执行与文件生成,"思考模式"升级为"专家模式"

23:36 IT之家(RSS) 精选 74 6月12日,字节跳动旗下AI应用豆包大范围上线“任务模式”,支持定时执行、零代码网页生成、一键PPT生成、数据可视化分析等全链路Agent执行。原“思考模式”升级为“专家模式”,调用豆包大模型2.0 Pro版本,强化深度推理能力。App顶部模式切换改为“快速、专家、任务”。基础功能免费,高阶服务付费,专业版三档:标准版68元/月或688元/年,加强版200元/月或2048元/年,专业版500元/月或5088元/年。 智能体 MCP/工具 产品更新 推荐理由: 豆包从对话助手转向能自主规划执行的任务模式,这是国产 AI 应用向 Agent 演进的一个明确信号,产品人该看看它如何用「快速、专家、任务」三种模式重塑用户预期。 22:12 MiniMax (official) @ MiniMax_AI 精选 81 MiniMax 发布开源权重模型 M3,约 428B 总参数、23B 激活参数,已上传 HuggingFace。该模型融合三种前沿能力:编码与智能体方面达 59.0% SWE-Bench Pro、66.0% Terminal Bench 2.1、34.8% SWE-fficiency、28.8% KernelBench Hard、74.2% MCP Atlas;采用 MiniMax 稀疏注意力将上下文窗口扩展至 1M token;原生多模态。同步上线 MiniMax Code 工具及 API 平台。权重与技术报告预计约 10 天后发布。 MiniMax (official) : Introducing MiniMax M3: The First Open-Weights Model to Combine Three Frontier Capabilities - Coding & Agentic Frontier:... Hugging Face 多模态 推理 模型发布 关联讨论 1 条 X:MiniMax (@MiniMax_AI) 推荐理由: 开放权重模型首次把编码 Agent 和多模态拉满,SWE-bench Pro 59% 逼近专有前沿,附带稀疏注意力 1M 上下文。做代码工具和 Agent 的团队应该都盯上它了。 18:24 Kimi.ai @ Kimi_Moonshot 精选 70 Kimi 发布并开源最新代码模型 Kimi-K2.7-Code Kimi 发布并开源最新代码模型 Kimi-K2.7-Code。相比 K2.6,其在 Kimi Code Bench v2 上提升 +21.8%,Program Bench 提升 +11.0%,MLS Bench Lite 提升 +31.5%。推理效率改进,推理 token 使用量降低 30%,长时编码任务中指令遵循和端到端成功率均提升。6x 高速模式即将推

智能体 MCP/工具 产品更新 Hugging Face 多模态 推理 模型发布 开源生态 编码 arXiv 视频 论文/研究 GitHub 开源/仓库 Anthropic 图像生成 教程/实践 具身智能 数据/训练 端侧 OpenAI 安全/对齐 部署/工程 政策/监管 行业动态 搜索
AI HOT ·

olmo-eval:面向模型开发循环的评估工作台

00:00 Hugging Face:Blog(RSS) 精选 74 olmo-eval 是基于 OLMES 标准构建的评估工作台,专为 LLM 持续开发中的反复评测场景设计。相比 OLMES,它减少了新增评测的实现工作量,支持 agentic 和多轮评测作为一等用例,并允许根据基准需求选择轻量直接运行或容器化隔离运行。采用模块化架构,模型、工具、容器环境、辅助模型均可独立替换。评测结果同时报告分数、标准误差和最小可检测效应。与 Harbor 侧重于发布不同,olmo-eval 聚焦开发阶段快速迭代,可逐问题对比检查点输出以区分真实改进与噪声。 Hugging Face 产品更新 开源生态 评测/基准 推荐理由: 做模型训练的人会感谢这个工具,它把评估从一次性打分变成能持续对比的流程,按题对比两个 checkpoint 的功能很实用,但如果你不训模型,这篇可以跳过。

Hugging Face 产品更新 开源生态 评测/基准