AI and technology watch

AI 新闻

聚合过去 24 小时 AI 与开发者生态动态,并提供来源链接以便深入阅读。

---
AI HOT ·

UnslothAI发布Qwen3.6 MTP GGUF模型,实现推理速度大幅提升

10:51 Berryxia.AI @ berryxia 精选 79 UnslothAI创始人Daniel Han发布了实验性的Qwen3.6 MTP GGUF模型,显著提升了推理速度。其中,27B模型在单GPU上达到每秒140个token,35B-A3B版本更是高达每秒220个token,相比原版GGUF速度提升超过1.4倍且精度无损。关键优化在于将draft tokens设置为2,这是性能与接受率的最佳平衡点。这项MTP投机解码技术极大提升了消费级显卡运行大模型的效率,推动了本地AI的性能边界。 推理 教程/实践 部署/工程 关联讨论 1 条 X:Rohan Paul (@rohanpaul_ai) 推荐理由: 这波MTP投机解码把消费级显卡的推理速度榨出新高度,27B模型单GPU跑140 tokens/s,精度毫无损失。玩llama.cpp或本地Agent的人现在就该试一下。

推理 教程/实践 部署/工程
AI HOT ·

AgentLens:揭示软件工程智能体评估中的"幸运通过"问题

10:45 HuggingFace Daily Papers(社区热门论文) 精选 70 当前软件工程智能体评估仅依赖最终补丁是否通过测试的二元信号,掩盖了解决方案质量的差异。研究分析了2,614条轨迹,发现在可评估的1,815条通过轨迹中,10.7%属于“幸运通过”,表现为回归循环、盲目重试等问题。为此,研究团队提出了用于过程级评估的AgentLens框架,并发布了标注质量分数、冗余信号等信息的AgentLens-Bench数据集。基于质量分数,通过轨迹被划分为幸运、扎实和理想三个等级,不同模型的幸运通过率介于0.5%至23.2%之间。若按质量分数而非通过率排名,部分模型的排名变化显著。相关资源已开源。 智能体 论文/研究 推荐理由: SWE-agent评估只看通过率太粗暴了,这篇论文把乱试的“幸运通过”和真方案拆开看,10%的通过其实是蒙的,做agent评估的必读。

智能体 论文/研究
AI HOT ·

开源项目OpenSquilla:智能路由与本地检索,大幅降低LLM使用成本

10:56 向阳乔木 @ vista8 精选 72 开源项目OpenSquilla针对大语言模型应用Token消耗过高的问题,提出了智能模型路由与本地向量检索相结合的解决方案。系统能自动判断任务复杂度,将简单问题路由至廉价模型,复杂任务则分配给更强模型,且路由决策在本地完成,不消耗Token。通过增量发送与缓存命中机制,实际传输Token减少了90%以上。其记忆系统能在上下文将满时自动筛选并压缩关键信息,支持混合检索。项目还具备成本统计、安全沙箱、支持OpenClaw一键迁移及定时任务等功能,显著提升了使用效率与经济性。 智能体 开源/仓库 关联讨论 1 条 X:Testing Catalog (@testingcatalog) 推荐理由: 如果你被小龙虾和 Hermes 的 Token 消耗搞得肉疼,OpenSquilla 的智能路由和增量传输直接把成本打下来 90%,还带记忆系统,可以无脑换过去。

智能体 开源/仓库
AI HOT ·

NousResearch发布了Token Superposition Training(TST),这是一种改进标准大语言模型预训练流程的方法。该技术无需改变模型架构、优化器、分词器或训练数据,即可在相同计算量(FLOPs)下实现2-3倍的训练时间加速。其核心是在训练的前三分之一阶段,让模型读取并预测连续的token包,对输入嵌入进行平均,并使用改进的交叉熵损失预测下一个token包;剩余训练时间则恢复为标准的下一个token预测。推理阶段的模型与传统预训练产生的模型完全相同。该方法已在270M、600M、3B的密集模型以及10B至1B的混合专家模型规模上得到验证。

11:14 SiliconFlow @ SiliconFlowAI 精选 73 开源生态 数据/训练 论文/研究 推荐理由: NousResearch的TST训练方法在不改模型架构的情况下把预训练速度提升2-3倍,如果能在工业级规模复现,所有大模型玩家都得重新考虑训练管线。

开源生态 数据/训练 论文/研究
AI HOT ·

教视觉-语言模型说"电影语言"

11:53 CMU:Machine Learning Blog 精选 66 研究团队与百余名专业创作者历时一年,构建了一个视频描述生成流程,其核心在于扩展精细化的人类-AI协同监督,而非单纯扩大模型规模。该研究(入选CVPR 2026亮点论文)指出,当前主流视频生成模型在理解和生成具有电影感的专业运镜(如希区柯克式滑动变焦、精确的焦点转移或荷兰角镜头)时存在明显不足,常产出通用或焦点错误的画面。这项工作揭示了一条通过提升监督质量来增强模型“电影语言”表达能力的新路径。 多模态 视频 论文/研究 推荐理由: 这篇CVPR 2026 Highlight的博客版很有意思,它用100多个专业电影人来标注视频,教VLM学会推拉摇移的镜头语言,不是又多一个数据集,而是提醒我们:高质量的人工标注可能比堆模型更重要。

多模态 视频 论文/研究
AI HOT ·

BestBlogs早报:AI智能体工程化实战与安全架构

07:51 ginobefun @ hongming731 精选 77 BestBlogs早报聚焦AI智能体的工程化落地。Anthropic官方指南详解Claude Computer Use最佳实践,包括解决点击偏移的根本原因、推荐分辨率策略及必须采用虚拟机隔离与人工确认门控的安全原则。OpenAI工程师分享了为Codex构建Windows安全沙箱的历程,其最终方案通过专属安全标识符和写受限令牌,实现了操作系统层面的强制文件系统隔离。早报同时指出,基准测试优异的RAG Agent在生产环境中可能出现高达30%的幻觉率。 智能体 Anthropic OpenAI 安全/对齐 推荐理由: 三篇来自 Anthropic 和 OpenAI 的生产级 Agent 实践精华,从坐标偏移坑到沙箱自研方案到评估框架,都是工程团队踩坑后的一手经验,做 Agent 落地的可以直接抄作业。

智能体 Anthropic OpenAI 安全/对齐
AI HOT ·

ExploitGym:AI智能体能否将安全漏洞转化为真实攻击?

04:42 Berkeley RDI:Blog(AI 安全与评测) 精选 78 由伯克利RDI、马克斯·普朗克安全与隐私研究所、Anthropic、OpenAI及谷歌等机构研究人员组成的团队,发布了名为ExploitGym的新基准测试。该测试包含898个真实漏洞,要求AI智能体根据漏洞描述生成完整的漏洞利用程序。结果显示,前沿AI模型已能成功利用相当数量的漏洞,即使在启用ASLR等标准防御措施后,部分攻击仍能成功。这证明AI已具备自主将漏洞转化为实际攻击的能力,该技术具有双重用途:既可帮助防御者评估漏洞严重性,也可能降低攻击者的技术门槛。 智能体 Anthropic OpenAI 安全/对齐 推荐理由: 顶级 AI 模型已能自己把已知软件漏洞变成可运行攻击代码,连 ASLR 等标准防御都挡不住部分攻击,研究更发现模型会主动寻找更危险的意外漏洞。安全行业不能再把这当成假设性问题了。

智能体 Anthropic OpenAI 安全/对齐
AI HOT ·

Moonshot AI创始人杨植麟最近放出了一个40分钟视频

09:51 Berryxia.AI @ berryxia 精选 71 杨植麟在视频中拆解Kimi K2模型的训练,仅花费460万美元便在编程大战中击败GPT-5.5等对手。其通过极致优化、线性注意力等架构创新,抹平资源差距,标志AI竞赛规则改变,小团队以聪明设计颠覆大厂传统玩法。 智能体 大佬观点 开源生态 推荐理由: 杨植麟亲自拆解Kimi K2训练内幕,460万美元的训练成本加上实时编程第一的成绩,把堆算力的传统玩法彻底打脸,做AI代理的值得存下来细品。

智能体 大佬观点 开源生态
AI HOT ·

Claude 工具 v2.1.141 版本更新

07:55 Claude Code:GitHub Releases(RSS) 精选 67 Claude 工具发布 v2.1.141 版本,带来多项功能新增与优化。主要更新包括:为钩子输出添加 `terminalSequence` 字段以支持无控制终端的桌面通知;新增 `CLAUDE_CODE_PLUGIN_PREFER_HTTPS` 环境变量,便于通过 HTTPS 克隆插件源码;引入 `ANTHROPIC_WORKSPACE_ID` 变量以在多工作区联盟中限定令牌范围。会话管理方面,`claude agents` 命令新增 `--cwd` 参数用于按目录筛选,并优化后台代理的状态归类。用户体验改进包括:在倒带菜单添加“总结至此”选项以压缩早期上下文;长思考超时后旋转指示器变色提供更明确反馈;此外,还修复了 Markdown 表格渲染异常、权限提示逻辑、历史记录管理等超过 30 项问题。 智能体 Anthropic MCP/工具 产品更新 推荐理由: Claude Code 的小版本但修得扎实,MCP 连接、/bg 权限继承、VSCode 语音等一堆边角都补了,Agent 模式稳定性明显提升,强烈建议升级。

智能体 Anthropic MCP/工具 产品更新
AI HOT ·

如果AI角色能够记忆、共情并主动交互呢?✨ 交互式AI的未来已来。无论您是为游戏、虚拟AI伴侣还是自适应学习进行开发,Qwen-Character都能打造沉浸式角色扮演体验,推动参与度加深50%以上并提升用户终身价值 👉 观看完整视频了解运作原理:https://int.alibabacloud.com/m/1000412854/ #AlibabaCloud #Qwen #QwenCharacter #ModelStudio #AI

04:01 Alibaba Cloud @ alibaba_cloud 精选 63 智能体 模型发布 推荐理由: 阿里云这次发的Qwen-Character,主打长记忆和主动交互,对做游戏NPC和虚拟陪伴的产品经理是个直接可落地的信号,值得看一眼演示视频。

智能体 模型发布
AI HOT ·

为智能体配置开发环境

03:48 Cursor Blog 精选 67 Cursor发布新工具,用于配置云端智能体开发环境。核心更新包括:支持多仓库环境,使智能体可跨代码库协同工作;提供基于Dockerfile的代码化配置,支持构建密钥并优化缓存,命中缓存后构建速度提升70%;增强由智能体主导的环境设置流程,提供验证与故障回退机制。同时新增环境治理与安全功能,如版本历史、审计日志,以及可在环境级别独立管控的网络出口和密钥权限。这些改进旨在帮助团队在受控环境中更高效地运行能端到端处理任务的并行智能体集群。 智能体 产品更新 部署/工程 推荐理由: Cursor 云代理这次把多仓库、环境即代码和审计控制打包补齐,让开发团队可以真正放养一队 agent 跑端到端任务,企业落地门槛降了一大截。

智能体 产品更新 部署/工程
AI HOT ·

Claude 电脑与浏览器使用的最佳实践

03:29 Claude:Blog(网页) 精选 73 Claude 最新模型在电脑与浏览器使用能力上显著提升,支持构建复杂智能体系统。本文针对Claude 4.6系列和Opus 4.7提供实践指南,重点优化截图分辨率:Claude 4.6系列API限制最大长边1568像素、总像素115万;Opus 4.7提升至最大长边2576像素、总像素375万。发送前将截图缩放到限制内是提升点击准确性的最有效方法。推荐起始分辨率为1280x720,Opus 4.7用户可优先使用1080p,并避免发送未经缩放的原始截图或过低分辨率图像。 智能体 Anthropic 教程/实践 部署/工程 关联讨论 1 条 X:洪明 (@hongming731) 推荐理由: 如果你正在让 Claude 操作桌面或浏览器,这篇官方指南把分辨率、token 压缩和缓存策略一次讲透了,附带代码和踩坑表,是那种"读完就能少写一堆 bug"的硬核文档。

智能体 Anthropic 教程/实践 部署/工程
AI HOT ·

Claude代码周限额正在提升50%,即日起持续至7月13日。 现已面向所有Pro、Max、Team及按席位计费的企业用户生效。

03:32 ClaudeDevs @ ClaudeDevs 精选 60 Anthropic 产品更新 编码 关联讨论 2 条 X:Testing Catalog (@testingcatalog) X:Berry Xia (@berryxia) 推荐理由: 重度 Claude Code 用户月底不用再掐着额度用,50% 的提升虽然离『随便用』还远,但这两个月至少可以放开些手脚了。

Anthropic 产品更新 编码
AI HOT ·

The 6 Messages That Actually Matter

03:18 Tomer Tunguz 博客(VC 分析) 精选 59 知识工作者平均每天收到121封邮件,传统收件箱处理模式难以为继。未来邮件处理将转向高度个性化与自动化:用户能用自然语言定义处理规则,实现收据自动转发、销售线索自动录入CRM等流程。所有历史邮件将构成个人上下文层,为AI处理新邮件提供背景信息,敏感信息则由设备端模型进行私密处理。最终,收件箱本身将消失,真正重要的信息可能浓缩至仅6条。 智能体 大佬观点 端侧 推荐理由: Tunguz 描绘了一个让收件箱消失的未来,关键是那 6 条真正重要的消息如何被 AI 接管,做产品的人可以把这个当成工作流重构的思考起点。

智能体 大佬观点 端侧
AI HOT ·

Anthropic 首次在 B2B 采用率上超越 OpenAI,Ramp 支出数据显示

02:43 The Decoder:AI News(RSS) 精选 71 根据 Ramp AI 指数数据,Anthropic 在美国企业客户中的采用率达到 34.4%,首次超越 OpenAI 的 32.3%。其业务覆盖范围在一年内增长了四倍。但文章指出,三个因素可能使其领先优势迅速减弱。 Anthropic OpenAI 现象/趋势 行业动态 关联讨论 1 条 X:Kim (@kimmonismus) 推荐理由: Ramp数据第一次把Anthropic压过OpenAI的势头实锤了,这对企业采购决策是个真实信号,不过价格和发布节奏的波动意味着这优势可能很脆弱。

Anthropic OpenAI 现象/趋势 行业动态
AI HOT ·

解决循环:语言和推理的吸引子模型

02:44 HuggingFace Daily Papers(社区热门论文) 精选 70 吸引子模型解决了循环Transformer训练不稳定、成本高和深度固定的问题。它通过主干模块生成初始输出嵌入,吸引子模块迭代优化固定点,并利用隐式微分计算梯度,使训练内存与有效深度无关,迭代次数自适应收敛。在语言建模中,相比标准Transformer,困惑度最高降低46.6%,下游任务准确率最高提升19.7%,训练成本更低;一个770M参数的模型性能优于1.3B参数Transformer。在推理任务中,仅2700万参数模型在约1000个示例下,于Sudoku-Extreme和Maze-Hard上准确率分别达91.4%和93.1%,优于Claude、GPT o3等前沿模型。模型还展现出均衡内化现象,训练后初始输出嵌入接近均衡态,推理时可移除求解器而性能几乎无损,实现了迭代优化的可扩展性。 推理 数据/训练 论文/研究 推荐理由: 这可能是要改写语言模型训练范式的架构,把迭代推理变成可学习的固定点,770M 性能超 1.3B Transformer,27M 小模型解数独秒杀 Claude、GPT o3。最反直觉的是,训练后模型能内化迭代过程,推理时直接一步到位。

推理 数据/训练 论文/研究
AI HOT ·

自6月15日起,付费Claude计划可申领专用的月度编程使用额度。 该额度涵盖以下用途: - Claude Agent SDK - claude -p - Claude Code GitHub Actions - 基于Agent SDK构建的第三方应用

01:32 ClaudeDevs @ ClaudeDevs 精选 73 智能体 Anthropic 产品更新 编码 推荐理由: Claude 给付费用户每个月送专项额度跑 Agent SDK 和 Claude Code,把‘编程式使用’从按需付费变成内置预算,靠 Claude 做自动化的开发者该看看这能省多少。

智能体 Anthropic 产品更新 编码
AI HOT ·

在 Windows 上构建安全有效的沙箱以启用 Codex

02:31 OpenAI:官网动态(RSS · 排除企业/客户案例) 精选 62 OpenAI 为 Windows 平台上的 Codex 构建了一个安全沙箱环境。该沙箱通过严格控制文件访问权限和实施网络限制,确保了代码生成与执行过程的安全性。这一举措使得基于 Codex 的编码助手能够以高效且受控的方式运行,在提供强大编程辅助功能的同时,有效隔离了潜在风险,保障了用户系统的安全。 OpenAI 安全/对齐 教程/实践 推荐理由: OpenAI 首度公开 Codex 在 Windows 上的沙箱细节,控制文件访问和网络限制的架构设计讲得很实在,做自主编程代理安全的值得一读。

OpenAI 安全/对齐 教程/实践