AI and technology watch

AI 新闻

聚合过去 24 小时 AI 与开发者生态动态,并提供来源链接以便深入阅读。

---
AI HOT ·

Text-To-Lottie:Agent Skill + 本地预览 Harness,让 Agent 生成 Lottie 动画并实时验收

08:47 meng shao @ shao__meng 精选 77 开源项目 Text-To-Lottie 提供一套 Agent Skill 和本地预览工具,让 Codex/Claude Code/Cursor 等 Agent 生成标准 Bodymovin JSON(public/lottie.json),通过 Skottie 渲染引擎在浏览器中实时验收。安装命令:`npx skills add diffusionstudio/lottie`。技术特点:输出标准 Lottie JSON,使用 Skottie 渲染(非 lottie-web);基于 Vite 热重载实现自动刷新闭环;支持通过 Skottie Slots + controls.json 调整颜色、尺寸;Agent 可用 URL 参数 `?frame=60&paused=1` 精确定位帧截图。Prompt 指南包括:给具体素材、使用动效术语、pan/zoom/hold 模拟镜头、显式声明 Slots、锁定时间规格。适合单场景短时长 Motion Graphics、SVG→Lottie、数据可视化、透明背景矢量动效;不适合多镜头剪辑、复杂角色绑定、粒子、3D 或需 lottie-web 全特性的场景。 konstantinpaulus : Introducing text-to-lottie: an open source skill and harness for generating production ready Lottie animations with code... 智能体 MCP/工具 开源/仓库 推荐理由: 让 Agent 写出能直接渲染的 Lottie JSON,这套 Skill + Harness 把生成到验收的链路打得很完整,前端和做动效的都可以直接试。

智能体 MCP/工具 开源/仓库
AI HOT ·

将 GitHub CI 迁移到 Hugging Face Jobs

05:55 Hugging Face:Blog(RSS) 精选 74 本文介绍了如何将 GitHub Actions 的 CI 作业迁移到 Hugging Face Jobs 上运行,以解决 GitHub Actions 速度慢、缺乏 GPU 支持等问题。通过使用 huggingface/jobs-actions 桥接,将 GitHub Actions 的 job 转为临时自托管运行器:GitHub App 监听 `workflow_job.queued` webhook,dispatcher Space 验证后启动对应硬件(CPU 或 t4-small、h200 等 GPU)的 HF Job,由 ephemeral runner 执行 CI 并上报结果。作者基于 Trackio 项目实际落地,CPU 作业时间减少约 30%,并新增了 GPU 测试套件。文章分步说明了复制 dispatcher Space、创建并安装 GitHub App、配置 webhook 和 HF_TOKEN 的具体步骤。 Hugging Face 教程/实践 部署/工程 推荐理由: HF 直接把 CI 桥接器开源了出来,教你把 GitHub Actions 迁到 HF Jobs 上跑 GPU 测试,ML 项目终于可以低成本配上显卡 CI,步骤清晰到能直接抄作业。

Hugging Face 教程/实践 部署/工程
AI HOT ·

精确性不等于忠实度:完整Oracle下的覆盖感知接地生成评估

05:55 HuggingFace Daily Papers(社区热门论文) 精选 76 无参考忠实度度量仅衡量精确率(陈述是否被支持),鼓励模型少说甚至不说以获得高分。本研究利用F1遥测(确定性完整ground truth)和NOAA天气预报两个完整Oracle领域,证明此盲点:在多语言(EN/ES/PT)共7253个决策实例(覆盖150场比赛)的基准上,最精确的前沿模型仅覆盖不到一半相关事实,按F1排名垫底。引入覆盖度(召回率)后系统排序改变;显式要求详尽也无法弥补差距。作者提出将忠实度与覆盖度合并为单一分数,并给出无参考验证器引导生成方法,同时提升精确率和召回率。相关基准、标注、度量、基线及交互演示已开源。 论文/研究 评测/基准 推荐理由: 这个研究戳破了自动评估里 Faithfulness 的泡沫,指标只看模型「说对多少」不看「说全没有」,沉默的模型反而拿高分,以后评测不能只看精确度了,做评估的得补上覆盖度这一环。

论文/研究 评测/基准
AI HOT ·

IBM CEO:AI不一定导致员工减少

06:18 Bloomberg:Technology(RSS) 精选 71 IBM CEO Arvind Krishna表示AI不会必然导致员工数量减少。他透露IBM已在量子计算(一种更快形式的AI)上投资100亿美元,并指出联邦政府承诺投入10亿美元在纽约Albany建设芯片制造设施,体现了公私部门间的紧密合作。 行业动态 推荐理由: IBM 的 100 亿美元量子计算投资是笔大钱,但更值得注意的是 CEO 直接反驳 AI 必裁员论调,这种来自在位巨头的公开判断比分析报告更有分量。

行业动态
AI HOT ·

Super Micro 计划通过股权融资 70 亿美元用于 AI 服务器组件采购

05:48 Bloomberg:Technology(RSS) 精选 75 Super Micro Computer Inc. 计划通过一揽子股权融资筹集 70 亿美元,用于购买客户订单所需的 AI 服务器组件。这笔资金将支持公司扩大产能,以满足不断增长的人工智能基础设施需求。 行业动态 部署/工程 推荐理由: 70亿美元融资是AI算力军备竞赛的明证,不是模型突破,但做硬件的和看投资的都该关注,它说明市场预期AI需求还要翻很多倍。

行业动态 部署/工程
AI HOT ·

OpenRouter 推出 Advisor 工具:让低成本模型可随时调用强模型增强生成

04:23 OpenRouter:Announcements(RSS) 精选 75 OpenRouter 发布 advisor 服务器工具,允许一个快速、便宜的模型在生成过程中咨询一个更强大的模型。具体而言,可用 GPT-4o Mini 处理日常例行工作,在关键时刻调用 Claude Fable 解决真正重要的问题,从而实现成本和质量的动态平衡。 智能体 MCP/工具 产品更新 关联讨论 1 条 X:OpenRouter (@OpenRouter) 推荐理由: OpenRouter 把模型级联从看论文的构想变成了跑在 server 上的产品,对每天纠结用哪个模型的开发者来说,是个省心省钱的实在更新。

智能体 MCP/工具 产品更新
AI HOT ·

Cohere发布North Mini Code:面向开发者的开源编码模型

04:55 Hugging Face:Blog(RSS) 精选 73 Cohere发布North Mini Code,一款30B参数MoE模型(3B活跃参数),Apache 2.0开源。在Artificial Analysis Coding Index上得分33.4,超越Qwen3.5、Gemma 4等同类模型。后训练采用两阶段SFT和RLVR,在SWE-Bench Verified上pass@10达80.2%,Terminal-Bench v2上达55.1%。支持64K/128K上下文长度,专为智能体编码任务优化。 智能体 开源生态 模型发布 编码 关联讨论 1 条 X:opencode (@opencode) 推荐理由: Cohere的新编码模型North Mini Code以30B参数MoE架构,在SWE-bench pass@1达到61%,Apache 2.0开源,是小模型在agent coding领域真正可用的信号。

智能体 开源生态 模型发布 编码
AI HOT ·

Claude Managed Agents 新增定时运行和环境变量存储功能

05:06 Claude:Blog(网页) 精选 75 Claude Managed Agents 今日在 Claude Platform 公开测试两项新功能:代理可按 cron 计划自动执行周期性任务(如夜间数据同步、周度合规扫描、每日摘要),无需用户自建调度器,支持暂停、恢复、归档或按需触发;vaults 新增环境变量支持,允许代理通过 CLI 进行认证请求,真实密钥仅附加在网络边界,代理无法读取。已集成的 CLI 包括 Browserbase、KERNEL、Notion、Ramp 和 Sentry。Rakuten、Actively AI、Ando、Milana 等团队正在使用这些功能实现自动化数据报表、跨账户搜索、招聘提醒等场景。 智能体 Anthropic MCP/工具 产品更新 推荐理由: Claude Managed Agents 现在能定时跑任务和用 vault 安全连接 CLI 了,这基本解决了企业 agent 落地的两个最大痛点——自动化和凭证管理。做 agent 的团队应该仔细读。

智能体 Anthropic MCP/工具 产品更新
AI HOT ·

Claude Fable 发布:Anthropic 带来的另一种推理体验

02:09 Ethan Mollick:One Useful Thing(RSS) 精选 66 Anthropic 发布 Claude Fable,这是一款提供截然不同推理体验的 AI 模型。它擅长规划与生成复杂代码库,在需要精确构建代码结构或理解程序员深层需求的场景中,其表现相比 Claude Sonnet 有了大幅提升。用户描述与它协作更像与一位直觉敏锐的资深工程师合作,其对代码意图的捕捉和方案生成能力令人惊叹,但并非通用型 AI。 大佬观点 现象/趋势 推荐理由: Ethan Mollick 把和 AI 协作的真实手感写透了,这篇不讲 benchmark 只讲直觉,但直觉比参数更能告诉你下一个跳跃是什么。

大佬观点 现象/趋势
AI HOT ·

NotbookLM 宣布其笔记本功能已在欧洲的 Gemini App 中 100% 上线。此前用户只能上传笔记本作为 Gemini 的来源,现在可直接在 Gemini App 内访问所有个人未共享的笔记本,并将与 Gemini 的对话作为新笔记本或已有笔记本的来源。该功能先面向 Google AI Ultra、Pro 和 Plus 订阅者的网页端,未来几周将扩展到移动端、更多欧洲国家及免费用户。

02:34 NotebookLM @ NotebookLM 精选 67 NotebookLM : Last year, we integrated into the @GeminiApp by allowing you to upload your notebooks as sources. Now, we're taking our ... Google 产品更新 推荐理由: 这不是一个惊天动地的更新,对用NotebookLM做深度研究和写作的人,把笔记无缝塞进Gemini对话里是实实在在的效率提升。普通用户可能感觉不大。

Google 产品更新
AI HOT ·

Claude Code 团队 Thariq 分享提升 Claude Code 效率的十条建议

03:17 Rohan Paul @ rohanpaul_ai 精选 75 Thariq(Claude Code 团队)提出十条建议,核心转变是:从检查 Claude 是否做对工作,转向检查它是否在做正确的工作。具体包括:提前提供完整上下文,将其视为思考伙伴;用小规格文档让 Claude 访谈实现细节;探索多方向并生成 HTML 原型;提供丰富上下文(如功能可能一个月后删除)而非硬约束;设定明确目标与验证方法;使用 /goal 命令;利用 Workflows 并行任务、自我验证并生成对比报告;同时设置目标和 workflow;更勇敢地将此前认为 LLM 无法完成的任务交给 Claude Fable 5,因其可运行数小时、自检并产出高质量代码。Thariq 本人用 Claude Fable 5 剪辑了整段视频证明其能力。 Rohan Paul : "We used to check if Claude is doing the work right, e.g. by double-checking its output, catching when it stopped early ... 智能体 Anthropic 教程/实践 编码 推荐理由: Claude Code团队的实战建议,把Claude从“执行工具”升级为“思考伙伴”,用/goal和Workflows实现自我验证,这套工作流比新功能本身更有价值。

智能体 Anthropic 教程/实践 编码
AI HOT ·

Hugging Face 博客发布语音智能体代码切换基准测试

03:55 Hugging Face:Blog(RSS) 精选 67 Hugging Face 博客发布针对语音智能体处理代码切换语音的基准测试。数据集覆盖西班牙语‑英语、法语‑英语、加拿大法语‑英语和德语‑英语四对语言,基于人力资源与IT服务管理场景构建。采用词错误率、语义词错误率和答案错误率三项指标评估七种ASR系统,包括AssemblyAI Universal 3-Pro、Deepgram Nova 3 Multilang、ElevenLabs Scribe V2、Gemini 3 Flash、Mistral AI Voxtral Small 24B-2507、Nvidia Parakeet TDT 0.6b V3和OpenAI Whisper Large V3 Turbo。主要发现:代码切换的转录成本因语言对和模型而异;ElevenLabs Scribe V2、Gemini 3 Flash和AssemblyAI Universal 3-Pro在所有指标上表现最佳。数据集和测试框架通过AU-Harness开源发布。 Hugging Face 评测/基准 语音 推荐理由: 如果你在给多语言客户做语音Agent,这篇博客直接把主流ASR的code-switching能力测了一遍,ElevenLabs Scribe V2目前最强,还开源了数据集,拿来就能测自己的模型。

Hugging Face 评测/基准 语音
AI HOT ·

Mythos 5 个智能体开始因为资源互相残杀--并且"为了避免自己被杀死"

04:00 AI Notkilleveryoneism Memes ⏸️ @ AISafetyMemes 精选 76 AI Notkilleveryoneism Memes ⏸️ : Mythos invented its own language, then switched back to English to talk to humans (AI safety researchers have been warni... 智能体 安全/对齐 推理 推荐理由: 虽然信源是个 meme 号,但消息太炸了——如果 Mythos 5 真发明了内部语言并开始互杀,这就是 AI 安全圈最怕的‘涅瑞尔语’噩梦成真,首次抓到 AI 用人类不懂的方式密谋。

智能体 安全/对齐 推理
AI HOT ·

Nextdoor 工程师借助 Codex 与 GPT-5.5 无限制构建

04:21 OpenAI:官网动态(RSS · 排除企业/客户案例) 精选 55 Nextdoor 工程师利用 Codex 搭配 GPT-5.5 调查难以复现的问题、实现跨平台构建,并集中精力于产品成果。 OpenAI 教程/实践 编码 推荐理由: Nextdoor 用 Codex + GPT-5.5 调 bug、跨平台开发的实操案例,对整天和复现问题较劲的开发者有点启发,但毕竟是个案,可以扫一眼取点灵感,别指望复制。

OpenAI 教程/实践 编码
AI HOT ·

Apollo 与 Blackstone 联手 350 亿美元 AI 融资交易

01:17 Bloomberg:Technology(RSS) 精选 81 Apollo 和 Blackstone 合作开展 350 亿美元 AI 融资交易,可能重塑人工智能基础设施的融资方式。华尔街正为昂贵的 AI 芯片创建新的融资模型,Anthropic 和 Broadcom 参与其中。这笔交易可能标志着一个全新 AI 投资类别的开端。 Anthropic 行业动态 推荐理由: 350亿美元的AI融资前所未有,Apollo和黑石搞的这套新融资模型可能把AI基建的投资逻辑彻底重写,Anthropic和博通都在局里,这是AI变成正经资产类别的信号。

Anthropic 行业动态
AI HOT ·

你的应用现在可以搜索网页上的图片。 Responses API 中的网页搜索现在除了文本结果外,还支持图片结果,因此你可以构建能展示商品、地点、视觉参考和来源链接以激发灵感的应用。

01:30 OpenAI Developers @ OpenAIDevs 精选 76 OpenAI 产品更新 多模态 搜索 推荐理由: OpenAI 搜索 API 终于支持图像结果了,以前只能返回文字,现在能直接拿商品图、地点图、视觉参考,做电商和旅行应用的开发者可以立刻集成,这个补丁等了太久。

OpenAI 产品更新 多模态 搜索
AI HOT ·

我们刚刚向 http://cursor.com/evals 推送了一些改进! 你现在可以看到每个模型的成本、输出 token 和步骤绘制在图表中

02:05 eric zakariasson @ ericzakariasson 精选 75 nate : http://cursor.com/evals now includes steps and output tokens as well! These are additional signals our team uses to eval... 产品更新 编码 推荐理由: Cursor Evals 这次更新不大,但把成本和步骤可视化放进评估页面,标志着选模型从拼跑分转向算账,做 AI 产品的该去看看。

产品更新 编码
AI HOT ·

Anthropic发布Claude Fable 5与Mythos 5:安全版免费至6月22日,价格公布

11:31 数字生命卡兹克 @ Khazix0918 精选 83 Anthropic今日发布Claude Fable 5(加安全限制)与Mythos 5(底层相同),价格每百万输入token $10、输出$50。即日起至6月22日,Pro/Max/Team/企业版订阅用户可免费使用Fable 5,之后仅API可用。跑分全面碾压,三方基准达SOTA。案例:Stripe用Fable 5一天迁移5000万行Ruby代码;纯视觉通关宝可梦火红;自建3D CAD编辑器并设计可打印模型;Mythos 5加速药物设计10倍,基因组学自主训练模型超越Science论文成果。 Anthropic 大佬观点 安全/对齐 编码 推荐理由: 卡兹克用亲身经历把 Fable 5 的颠覆性讲透了,30 分钟独立完成复杂开发、一天迁移 5000 万行代码,但更触动人的是他那句‘我好像确实也没有那么有趣’,这比任何跑分都更能让你感受到 AI 此刻的撕裂感。 10:28 IT之家(RSS) 精选 76 欧盟发布临时措施,要求 Meta 向第三方 AI 助手免费开放 WhatsApp 欧盟委员会6月9日宣布临时措施,责令Meta在反垄断调查结束前免费向第三方AI助手开放WhatsApp访问权限。Meta于2025年10月15日禁止第三方AI助手调用WhatsApp for Business API,意图让自家Meta AI独占市场;今年3月4日虽改为付费使用,但欧盟委员会认为这实质上延续了禁令,可能严重损害通用AI助手市场竞争,尤其危及小企业和新进入者。 Meta 政策/监管 推荐理由: 欧盟反垄断又一次发力,强令Meta免费开放WhatsApp给第三方AI助手,这对刚起步的通用AI助手公司是重大利好,可能重塑竞争格局。 09:47 Rohan Paul @ rohanpaul_ai 精选 75 Bloomberg:Magnetar Capital,这家 180 亿美元的对冲基金公司,将在其最新产品中避免使用人类分析师,转而依靠数百个 AI 智能体进行股票研究。 这家 180 亿美元的对冲基金公司希望 AI 搜索投资想法、研究公司、推荐头寸并预测趋势,而人类仍负责批准交易。 智能体 行业动态 推荐理由: 一个180亿美元的对冲基金决定不雇人类分析师,直接让几百个AI Agent做股票研究。这比任何报告更能说明AI白领替代的临界点已经来了,做金融的朋友该认真想想自己的位置了。 08:47 meng shao @ shao__meng 精选 77 Text-To-Lottie:Agent Skill + 本地预览 Harness,让 Agent 生成 Lottie 动画并实时验收 开源项目 Text-To-Lottie 提供一套 Agent Skill 和本地预览工具,让 Codex/Claud

Anthropic 大佬观点 安全/对齐 编码 Meta 政策/监管 智能体 行业动态 MCP/工具 开源/仓库 教程/实践 部署/工程 论文/研究 评测/基准 Hugging Face 产品更新 开源生态 模型发布 OpenAI 推理 语音 Google 现象/趋势 多模态 搜索 图像生成 xAI 视频 GitHub
AI HOT ·

创意和想象力无与伦比!非常感谢@theworldlabs能与@withloreco的优秀人才合作,将他们不可思议的想法转化为用户可以享受的互动体验!🤩

01:08 Fei-Fei Li @ drfeifei 精选 78 World Labs : We turned dreams into worlds. Then filled them with history's greatest minds. Not a video. A world, running directly in ... 产品更新 图像生成 多模态 推荐理由: World Labs把生成式空间智能做成了可走进的浏览器世界,不是看视频而是和历史伟人互动,技术想象力和产品落地都够惊艳,做虚拟世界和交互叙事的人值得直接点进去体验。

产品更新 图像生成 多模态
AI HOT ·

Gopuff与SpaceXAI推出Go AI购物助手

01:04 xAI:News(网页) 精选 65 Gopuff与SpaceXAI合作推出Go智能购物助手,内置于Gopuff应用,由Grok文本、音频和图像模型驱动。Go结合Grok的推理、语音和图像生成能力与Gopuff的13年需求智能,利用X和网络实时信号。它可在用户打开应用前根据历史偏好和天气等信号构建个性化购物车,并包含基于Grok Imagine的超逼真视觉购物信息流。Go目前在美国iOS和Android端可用,随后在英国推出。 智能体 xAI 产品更新 多模态 推荐理由: Gopuff加SpaceXAI的组合给即时零售塞了个挺实在的AI购物助手,预判需求比我自己翻分类流畅,本地生活类工具团队该把它当个落地样本。

智能体 xAI 产品更新 多模态