AI and technology watch

AI 新闻

聚合过去 24 小时 AI 与开发者生态动态,并提供来源链接以便深入阅读。

---
GitHub Blog ·

GitHub Copilot 如何在不牺牲任务质量的前提下降低 AI 编码成本

GitHub 工程师 Erik Kristensen 分享了 Copilot 降本的四项改动:选择性压缩工具输出、移除 view 工具行号前缀(线下推理成本降约 5%,线上用户日均推理成本降约 3%)、压缩 task-tool 提示词(每轮省约 1300 token,每活跃小时归一化成本降 2.9%)、后台任务完成后直接交付结果(AI Credits 用量降约 2.3%)。

技巧观点
X:Rohan Paul (@rohanpaul_ai) ·

美国司法部就 OpenAI 版权诉讼提交意见书支持训练属于合理使用

美国司法部在 OpenAI 与纽约时报的版权诉讼中提交意见书,主张用受版权文本训练 LLM 一般应属合理使用,称模型训练具有非凡转换性,并以国家安全为由警告全面许可要求会削弱美国 AI 开发者竞争力。该意见书属建议性质、不约束法院,仍将数据获取方式与具体输出是否复制受保护段落作为独立问题留给法院逐案判断。

技巧观点
X:Rohan Paul (@rohanpaul_ai) ·

美国司法部在 OpenAI 与纽约时报版权诉讼中支持训练属于合理使用

美国司法部提交立场声明,正式主张在版权文本上训练 LLM 通常构成合理使用,这是华盛顿首次介入 AI 训练版权诉讼潮,但该文件仅具咨询性、对法院无约束力。司法部区分了获取数据、训练和输出三个环节,认为训练用途不同于发表文章、不会替代原作;并警告一刀切的许可要求会抬高小公司门槛。法院仍需逐案裁定,但采纳该框架会把法律压力更多转向数据获取和具体输出环节。

技巧观点
Google AI:DEV 作者专属(RSS) ·

Google AI 团队分享如何为 LLM-as-a-Judge 评测编写可靠的评分标准

Google AI 团队发布教程,讲解如何为 LLM-as-a-Judge 评测编写可靠的布尔式评分标准,指出模糊提示会导致评估不一致和浪费 token。文中给出四条经验:问题保持原子化且互不重叠、只让评判模型评估客观事实(可用 RFC 2119 术语如 MUST 表述)、只评 prompt 中明确要求的内容、用专家标注的 golden set 校准评判模型直至与人类评分一致。

技巧观点
公众号:数字生命卡兹克 ·

UU远程新版本上线:完整 TUI 渲染与多终端会话管理,强化远程 Vibe Coding 体验

UU远程于9月2日上线新版本,重点优化终端功能,补齐 TUI 渲染交互与终端会话管理能力。主要更新包括:Mac 免密码登录、移动端输入优化并新增调用系统输入法的独立输入框、可同时创建和管理多个终端会话并支持手机与电脑间跨端同步接管(通过 uuyc-cli lterm 命令)。

AI 产品
X:Rohan Paul (@rohanpaul_ai) ·

Nvidia 接近以 129 亿美元收购 Hugging Face

Bloomberg 报道 Nvidia 正接近以约 129 亿美元收购 Hugging Face,交易总额可能达约 140 亿美元,双方尚未达成最终协议,时间与细节仍可能变动。该价格约为 Hugging Face 2023 年融资轮 45 亿美元估值的 2.9 倍,按年化收入约 1.5 亿美元计算相当于 86 倍,Nvidia 还谈及在交易中加入 10 亿美元的员工留任方案。

行业动态
X:通义千问 / Qwen (@Alibaba_Qwen) ·

通义千问发布 Qwen3.8-Max-0902:2.4T 参数、1M token 上下文

通义千问(Qwen)宣布 Qwen3.8-Max 升级为 Qwen3.8-Max-0902,具备 2.4T 参数和 1M token 上下文窗口。该版本针对编码与协作(Coding & Cowork)进一步后训练,面向复杂企业任务、科学研究和长程工作流。

AI 模型
X:Thariq (@trq212) ·

Anthropic 发布 Claude Fable 5.1 与 Claude Mythos 5.1,作者实测分享使用建议

Anthropic 宣布推出 Claude Fable 5.1 和 Claude Mythos 5.1,称其为编码和知识工作领域最先进的模型。作者 Thariq 表示花了很多时间深入研究,认为模型很好,长文评测后续发布;建议对需要较少验证或边缘用例较少的任务使用较低 effort,且切换 effort 不再破坏 prompt cache。

AI 模型