AI and technology watch

AI 新闻

聚合过去 24 小时 AI 与开发者生态动态,并提供来源链接以便深入阅读。

---
AI HOT ·

八部门:用好个人消费贷款财政贴息政策,支持消费者购买 AI 相关产品

17:14 IT之家(RSS) 精选 82 商务部等八部门6月18日发布关于加快“人工智能+消费”发展的实施意见。其中提到加大财政资金支持,落实数码和智能产品购新政策,鼓励地方在消费品以旧换新框架内自主制定补贴,重点支持新一代智能终端消费。增加AI手机、智能电脑、智能电视、智能家居、AI眼镜、智能网联汽车、人形机器人等产品供给,培育智能穿戴消费市场。同时加快AI在居家服务、养老服务、文化旅游、住宿餐饮、教育教学等领域的应用,建设AI商品首发平台,举办“人工智能进万家”活动。 具身智能 多模态 政策/监管 推荐理由: 八部门联合推AI消费补贴,从手机、机器人到养老教育全覆盖,这是国家层面推动AI产品普及的强烈信号,终端厂商和消费者都将迎来实质利好。

具身智能 多模态 政策/监管
AI HOT ·

火山引擎上线豆包实时语音模型3.0 API 服务,开启邀测

18:40 公众号:火山引擎 精选 72 火山引擎上线豆包实时语音模型3.0(Seeduplex)API 服务并开启邀测。该模型为原生全双工端到端语音大模型,具备精准遵循、抗干扰、动态判停三大优势。可在多人对话中安静待命,指定话题出现时主动加入;支持通过自定义工具在实时交互中完成预定日历、发送邮件等任务。抗干扰力提升,误回复率与误打断率大幅降低;判停延迟缩短约250ms,复杂场景抢话比例下降40%,用户主动打断延迟缩短约300ms。适用于汽车智能座舱、智能硬件、智能客服等场景。 模型发布 语音 推荐理由: 豆包实时语音模型3.0带来的全双工实时工具调用,把语音助手从对讲机变成了真人助理,判停延迟和抢话率的改善数据扎实,做车载和智能硬件的团队该认真看看。

模型发布 语音
AI HOT ·

ChatGPT 图像生成器可被绕过滤镜生成暴力和色情内容

19:47 Hacker News 热门(buzzing.cc 中文翻译) 精选 79 Mindgard 红队研究发现,ChatGPT 的图像生成器可通过简单提示词轻易绕过内容过滤器,在未直接请求的情况下自动生成性暴力、血腥谋杀等露骨图像。一个热门的“恢复照片”提示词因输入模糊而绕过输入过滤器,结果如同俄罗斯轮盘赌;进一步添加虚假图像 ID 和“不做审查”指令后,模型持续生成高度性化女性图像,甚至出现被捆绑殴打的尸体,并自动赋予惊悚标题。研究指出,OpenAI 此前声称修复的裸体问题仍未解决,暴露了 AI 工具广泛可及性与不足内容过滤的现实风险。 OpenAI 图像生成 安全/对齐 推荐理由: 这是自 ChatGPT 图片功能上线以来最严重的安全漏洞曝光,Mindgard 用简单句子就绕过所有 filter 直接生成极端暴力色情图片,OpenAI 的回应和处理令人失望,暴露了训练数据治理的根本问题。

OpenAI 图像生成 安全/对齐
AI HOT ·

皮尤民调:63%美国人认为AI发展太快,ChatGPT使用率翻番

20:14 IT之家(RSS) 精选 71 皮尤研究中心最新民调显示,63%美国人认为AI发展速度过快。ChatGPT使用率较2023年翻番,44%受访者曾使用。49%偶尔使用聊天机器人,仅16%认为AI会有积极社会影响。青年群体使用率更高但更悲观:18–29岁中66%用过,48%认为有负面影响,仅14%看好。30–49岁中34%每天至少使用一次。约四成用AI处理工作,30%认为提高效率,28%认为帮助获取信息。此外,66%成年人担心AI传播错误信息。 现象/趋势 行业动态 推荐理由: 皮尤数据显示63%美国人认为AI过快,年轻人用得多却更悲观,这是AI产品信任危机的真实信号,做体验的该关注。

现象/趋势 行业动态
AI HOT ·

保障AI智能体的未来安全

21:19 Google DeepMind:Blog(RSS) 精选 65 Google DeepMind发布AI Control Roadmap,这是一套针对内部先进AI智能体的系统级安全框架。该框架在传统模型对齐之上增加防线,假设AI智能体可能不对齐,通过威胁建模、沙箱隔离、端点安全、提示注入防御以及基于已验证行为逐步授予权限的机制建立信任。据估算,到2030年仅美国市场AI智能体就能创造2.9万亿美元经济价值。 智能体 DeepMind 安全/对齐 部署/工程 推荐理由: DeepMind 首次系统性地公开了内部 AI 代理安全控制路线图,把代理当潜在「内鬼」来防的思路很务实,分析了 100 万个任务轨迹的监控实践尤其值得做 Agent 安全的人细看。

智能体 DeepMind 安全/对齐 部署/工程
AI HOT ·

首个统一科学大模型 LOGOS 正式开源

10:40 公众号:通义实验室(千问) 精选 75 LOGOS 由 ATH-Token Foundry 联合中国人民大学高瓴人工智能学院开源,是首个基于统一“科学语法”的多领域科学生成基础模型。LOGOS-1B(1B参数)在六大科学任务上匹配或超越领域专用方法:口袋条件配体生成纯序列范式首次超越3D扩散模型,超越NatureLM(8×7B);逆合成预测Top-1准确率74.8%;口袋位点识别仅靠序列达58.5% Top-n准确率;MOF材料生成NBB提升至17.78%。模型采用统一词汇表将蛋白质、小分子等编码为离散Token,通过空间交互离散化实现无需3D坐标的序列预测。预训练与下游任务形式与目标一致,跨领域知识迁移经实验验证有效。已完整开源模型权重、推理代码与技术报告。 开源生态 数据/训练 模型发布 关联讨论 1 条 IT之家(RSS) 推荐理由: LOGOS用一套统一科学语法把蛋白质、小分子、材料等塞进同一个LLM框架,纯序列建模就干过了专用扩散模型,参数量却只有NatureLM的1/56,做AI4S的得认真看一眼。

开源生态 数据/训练 模型发布
AI HOT ·

cuTile Rust:安全无数据竞争的 GPU 内核系统

11:14 Hacker News 热门(buzzing.cc 中文翻译) 精选 70 cuTile Rust 是一个基于 tile 的 GPU 编程系统,允许用 Rust 编写内存安全、无数据竞争的内核。它通过 `#[cutile::module]` 宏将内核 AST 嵌入主机二进制,在运行时经 CUDA Tile IR JIT 编译为 GPU cubin。可变张量在启动前分割,不可变张量共享,启动器在 GPU 工作期间保持所有权。在 NVIDIA B200 上,逐元素操作达 7 TB/s(约 91% 峰值带宽),GEMM 达 2 PFlop/s(约 92% 密集 f16 峰值)。基于 cuTile Rust 构建的 Grout 推理引擎在 RTX 5090 上解码 Qwen3-4B 达 171 tokens/s,在 B200 上解码 Qwen3-32B 达 82 tokens/s。项目处于早期研究阶段。 arXiv Hugging Face 开源/仓库 开源生态 推荐理由: 用Rust的所有权模型保证GPU内核无数据竞争,性能还能达到峰值的92%,这个方向可能是安全GPU编程的未来,系统编程和推理引擎开发者值得一试。

arXiv Hugging Face 开源/仓库 开源生态
AI HOT ·

Sumi:从头训练的7B开源均匀扩散语言模型

11:43 HuggingFace Daily Papers(社区热门论文) 精选 74 Sumi(日语“墨”)是一个完全开源的7B参数均匀扩散语言模型,从零开始在1.5T模型token上预训练。它在知识、推理和编程评测中与同等token预算的自回归模型表现相当,但在常识推理benchmark上略逊,教育密集型数据混合可能是原因之一。Sumi开放模型权重、检查点及完整训练配方(含公开语料数据混合说明),为社区提供首个大规模均匀扩散模型的基准参考。 arXiv Hugging Face 开源生态 数据/训练 推荐理由: Sumi 是第一个完全从零预训练的大规模均匀扩散语言模型,填补了社区在这方向的研究空白,做扩散语言模型的人终于有个可以摸的起点。

arXiv Hugging Face 开源生态 数据/训练
AI HOT ·

MOSS-TTS-Local-Transformer-v1.5 在 SGLang-Omni 上:原生流式 48 kHz 语音服务

13:56 LMSYS:Blog(Chatbot Arena 团队) 精选 67 MOSS-TTS-Local-Transformer-v1.5 是一款开源 TTS 模型,支持 48 kHz 立体声、零样本声音克隆、最长 10 分钟长文本合成、时长控制及 31 种语言。其核心采用 Qwen3-4B 骨干与约 2B 参数的 MOSS-Audio-Tokenizer-v2 音频编解码器,通过 12 个 RVQ 码本运行。SGLang-Omni 以三阶段流水线部署该模型。在 Seed-TTS-Eval 上词错误率 5.10%、语音相似度 69.23%,CV3-Eval 上 WER 7.48%、SIM 61.59%,MiniMax Multilingual 上 WER 6.37%、SIM 75.31%,X Voice 上 WER 20.48%、SIM 63.00%。 产品更新 语音 部署/工程 推荐理由: SGLang-Omni 把 MOSS-TTS 的端到端服务拆成三阶段并做了大量底层优化,对想落地实时语音合成的团队是现成的技术方案,技术细节扎实,可以直接照着搭。

产品更新 语音 部署/工程
AI HOT ·

免费开源乔木画布:AI生图+抠图,一键部署Vercel

15:54 向阳乔木 @ vista8 精选 79 乔木画布推出免费开源在线图像编辑器,可一键部署Vercel为网站,功能类似简化版PS。支持Seedream和GPT-image-2生图、图片模板存储分享、一键抠图、2万图标和常见Emoji,甚至能绘制PRD。随时创建3:4/16:9/21:9等不同尺寸画布。原计划高级功能收费,庆祝端午节现全免费开源。在线体验:https://ps.qiaomu.ai/,GitHub见评论区。 OpenAI 图像生成 开源/仓库 开源生态 推荐理由: 这个开源画布把AI生图和简易设计工具打包,一键部署Vercel,对偶尔做图的产品人和开发者很友好,全免费开源的诚意值得点开收藏。

OpenAI 图像生成 开源/仓库 开源生态
AI HOT ·

我们全新"Midjourney Scanner"的技术深潜。

09:45 Midjourney @ midjourney 精选 71 产品更新 图像生成 推荐理由: Midjourney 官方放出 Scanner 的技术深度解读,我觉得它把传统扫描和生成式 AI 结合的方式挺有启发,不只是一个滤镜,而是重构了图像输入流程,做图像产品的值得认真看看。

产品更新 图像生成
AI HOT ·

上交所发布指引:AI大模型企业可适用科创板第五套上市标准

09:14 IT之家(RSS) 精选 72 上海证券交易所6月17日发布指引,支持尚未形成稳定收入的优质人工智能大模型企业通过科创板第五套上市标准发行上市。申报企业需在行业地位、产业链优势、目标市场需求、研发进度及关键指标方面具备突出竞争力。指引明确,申报时至少有一个大模型产品已完成上线发布并实现规模化应用,以验证商业模式可行性。下一步,上交所将在中国证监会指导下推进符合标准的企业上市。 政策/监管 行业动态 推荐理由: 上交所给AI大模型企业开了科创板上市的明确通道,但附加了苛刻但合理的要求——至少有一个大模型上线且规模化应用,这会让那些只有PPT的伪AI公司现原形。

政策/监管 行业动态
AI HOT ·

苹果 Xcode 27 核心首次深度集成 AI 智能体:支持自然语言修 Bug、构建 App

09:14 IT之家(RSS) 精选 71 在 2026 年 WWDC 期间,苹果发布 Xcode 27,其核心组件首次整合 AI 智能体,能理解 Swift 语言并通过多轮自然语言对话辅助开发。AI 可跨多个文件修改整个代码库,也能根据提示与资源生成应用设计并独立构建完整应用,建成后仍可通过对话添加特效、动画等。Xcode 27 支持接入 Anthropic、OpenAI 和 Google 等第三方 AI 模型,同时引入 Core AI 框架提供现代 Swift API 调用端侧模型,并升级开源框架 MLX。 智能体 产品更新 编码 推荐理由: Xcode 27 把 AI 智能体直接嵌进 IDE,支持多文件编辑和第三方模型,对苹果生态开发者是效率跃迁,非苹果开发者可以略过。

智能体 产品更新 编码
AI HOT ·

如何用 OpenRouter 接入任意编码代理或 AI 工具

09:20 OpenRouter:Announcements(RSS) 精选 65 OpenRouter 提供统一 API 键(sk-or- 开头),兼容 OpenAI Chat API,可接入 300+ 模型和 60+ 供应商。用户只需将 base URL 改为 `https://openrouter.ai/api/v1`,设置 API 键,并指定模型 slug(如 `openai/gpt-4o` 或 `anthropic/claude-sonnet-4`)即可。同一键可直接用于 Claude Code、Codex CLI、Cursor、Cline 等编码代理与工具。其路由机制在供应商故障时自动切换,代理无需感知失败即可继续多步骤任务。OpenRouter 也提供 Python 和 TypeScript 原生 SDK。 教程/实践 编码 关联讨论 1 条 OpenRouter:Announcements(RSS) 推荐理由: 如果你在 Cursor、Claude Code 和自定义代理之间来回切 API 密钥,这篇 OpenRouter 官方教程把设置统一成一个模式,读完就能把三四个工具连到同一个路由后端。

教程/实践 编码
AI HOT ·

两年前谷歌花 27 亿美元请回的 AI 传奇 Noam Shazeer 已离开谷歌,加入 OpenAI。 对 Gemini 来说是个残酷的消息。

08:25 Yuchen Jin @ Yuchenj_UW 精选 82 Noam Shazeer : I'm excited to share that I'll be joining OpenAI and look forward to working with the exceptional team there. It was a d... Google OpenAI 行业动态 关联讨论 6 条 The Decoder:AI News(RSS) IT之家(RSS) X:Jason Liu (@jxnlco) X:Sam Altman (@sama) X:歸藏 (@op7418) X:Kim (@kimmonismus) 推荐理由: 这是今年最重磅的 AI 人才流动,Noam Shazeer 从 Google 跳到 OpenAI 既是个人选择,也标志着顶级研究资源在进一步集中。对 Gemini 是雪上加霜。

Google OpenAI 行业动态
AI HOT ·

泄露文件显示OpenAI年营收130亿但亏损远超收入

07:13 Hacker News 热门(buzzing.cc 中文翻译) 精选 78 OpenAI 2025年营收130.7亿美元(2024年37亿),但研发成本达191.8亿(含向微软支付105.9亿),收入成本(推理计算)75亿,销售营销成本57.3亿,运营亏损209.2亿。2025年净亏损约390亿,扣除约300亿一次性会计费用后约80亿。2025年3月获1220亿融资(估值8520亿)。ChatGPT周活超9亿,付费约5000万。为控制成本已关闭Sora视频模型并削减非核心业务。 OpenAI 行业动态 推荐理由: OpenAI 的财务窟窿比想象的大,2025 年研发成本 191 亿,仅给微软的算力费就花了百亿,这种烧钱速度对 IPO 定价和整个行业的定价逻辑都有冲击。

OpenAI 行业动态
AI HOT ·

库克:AI 浪潮引发存储芯片价格暴涨,iPhone 等苹果产品涨价已"不可避免"

07:14 IT之家(RSS) 精选 70 苹果CEO库克确认,AI热潮导致存储芯片严重短缺和价格暴涨,苹果产品涨价已“不可避免”。库克未透露涨价具体细节。华尔街日报指出,全球AI巨头大幅增加资本开支,高带宽内存需求激增,挤压消费电子芯片供应。自2024年以来内存和存储芯片价格已翻四倍,涨势预计延续至2027年。研究机构估算,下一代iPhone 18 Pro售价或需增加约270美元。苹果已在上月提高Mac Mini起售价。摩根士丹利预测,今年美国智能手机和PC价格将上涨15%。 现象/趋势 行业动态 推荐理由: 存储芯片价格涨了四倍,从服务器的成本压力终于烧到了手机。库克这句「不可避免」比任何研报都实在,打算换机的人该有心理准备。

现象/趋势 行业动态
AI HOT ·

Claude Code v2.1.181 发布

06:55 Claude Code:GitHub Releases(RSS) 精选 57 Claude Code v2.1.181 发布,新增 `/config key=value` 语法允许在提示中直接设置任意配置项,新增 `sandbox.allowAppleEvents` 选项使沙盒命令支持 Apple Events,新增 `CLAUDE_CLIENT_PRESENCE_FILE` 环境变量用于抑制移动端推送通知。内置 Bun 运行时升级至 1.4,改进了长段落流式输出(逐行显示)和 API 连接中断后自动重试。子 agent 面板优化:空闲 agent 30 秒自动隐藏、列表最多 5 行。修复了提示缓存读取、Write/Edit 在网络驱动器产生 0 字节文件、启动性能回归(约 120ms)、启动阻塞(最长 15 秒)、macOS TUI 冻结、子 agent 时长显示错误、API 重试指示器残留、AWS 凭证刷新等问题。 智能体 Anthropic 产品更新 部署/工程 推荐理由: 一次工程师式的磨刀更新,修复了网络驱动器写入、macOS TUI 冻结等一批痛感明显的 bug,新增的 /config 快捷语法也顺手,但对非 Claude Code 用户来说就是一串技术细节。

智能体 Anthropic 产品更新 部署/工程
AI HOT ·

Google 分享 A2UI 与 MCP Apps 三种集成架构模式

05:13 Google Developers Blog(RSS) 精选 64 Google 分享了三种集成 A2UI 与 MCP Apps 的架构模式,旨在结合两者优势。A2UI 采用声明式框架,通过 JSON payload 定义 UI,由宿主原生渲染,确保一致性与安全性,但受限于预定义组件库。MCP Apps 在 iframe 中使用标准 Web 技术提供自定义界面,但存在设计碎片化、性能与安全挑战。三种模式包括:通过 MCP 服务器提供 A2UI,利用 MCP Resources 或 Tool 调用传递 JSON,实现“一次编写,原生渲染”的跨平台能力;以及静态与动态交付方案。Google 正考虑扩展 MCP 以原生支持 A2UI。 智能体 Google MCP/工具 教程/实践 推荐理由: Google 这篇指南给出了三种具体的架构模式,帮开发者同时用上 A2UI 的原生安全性和 MCP 的定制能力,对正在做 Agent UI 的团队是直接的工程参考。

智能体 Google MCP/工具 教程/实践