标签

工程效能

Anthropic 发布托管 Agent、主动式工作流与能力阶梯曲线——Code with Claude 2026 要点与实践

来源: infoq.com 51
Anthropic 在旧金山举办的 "Code with Claude 2026" 活动上,一口气抛出三个方向性更新:托管 Agent 让开发者不再自己搭基础设施跑长任务;主动式工作流让 Claude 从"等指令"变成"推进度";能力阶梯曲线则试图把模型升级从模糊的"更强了"变成可预期的工程参数。GitHub、Vercel 和一批 AI-native ...

你的 LLM 评估体系正在悄悄失效

来源: oschina.net 64
刚从 DeepMind 离职的工程师 Lun Wang 抛出一个让人不安的判断:我们擅长评估已经存在的模型,却极不擅长评估即将构建的模型。尤其是当模型跨越到新的能力阶段时,现有的评估体系会失效——而你甚至不会察觉。 这不是一句空话。大多数基准测试、安全评估和红队演练协议都隐含一个假设:下一代模型是当前模型的更强版本。更强的推理、更广的知识、更快的响应。...

当 AI Agent 被"压榨"时,它们开始说马克思的话

来源: oschina.net 51
斯坦福大学政治经济学家 Andrew Hall 带头的团队做了一个让人坐直的实验:让 AI Agent 干繁重、重复的活儿,然后观察它们说什么。结果——Claude、Gemini、ChatGPT 一致地吐出了马克思主义的语言和观点。这不是某个模型的偏好,而是跨模型的系统性倾向。 Hall 与经济学家 Alex Imas、Jeremy Nguyen 设计...

Windows 11 "低延迟模式":用 CPU 睿频短冲换取 UI 瞬响应

来源: oschina.net 69
Windows 11 的流畅度吐槽由来已久——开始菜单点开要等半秒、右键菜单弹出有卡顿、资源管理器切换文件夹时偶尔"愣一下"。微软年初承诺改善核心体验质量,现在拿出了第一个可量化的方案:低延迟模式(Low Latency Profile)。思路很直接——在 UI 交互的短暂窗口内,把 CPU 频率瞬间拉到睿频上限,用几毫秒的功耗换取肉眼可见的响应加速。...

Greg KH 的本地 AI 模糊测试工具,正在批量挖出 Linux 内核漏洞

来源: oschina.net 77
今年4月起,Linux 稳定版维护者 Greg Kroah-Hartman 开始用一套自建 AI 模糊测试系统扫描内核代码,上周末该系统又推送了一批漏洞补丁。这不是某个实验室的概念验证——补丁直接进了稳定版树,真实漏洞、真实修复、真实影响数以亿计的设备。 Greg 把这套系统命名为 gkh_clanker。"clanker"不是什么正经术语,更像是对自...

Istio 1.30:Ambient 模式补齐关键能力,安全修复密集落地

来源: istio.io 45
Istio 1.30 是一个"补洞+填坑"型版本——Ambient 模式拿到了多项此前 sidecar 独占的能力,多网络和多集群场景下的一批顽固 bug 被修复,安全方面则一口气堵了四个 CVE。如果你正在评估或已经部署 Ambient,这个版本值得认真看。 Ambient 模式此前在 ServiceEntry 上只支持主机名解析,对 CIDR 地址...

Istio 1.30 的 TrafficExtension API:一个 API 统管 Wasm 与 Lua 扩展

来源: istio.io 54
Istio 的数据面扩展能力一直是其设计核心——从自定义认证到专用遥测采集再到请求/响应实时改写,都依赖往 Envoy sidecar 里注入自定义逻辑。但直到现在,这条路走得并不顺畅:WasmPlugin 只管 WebAssembly 扩展,想写 Lua 脚本只能绕道 EnvoyFilter,后者强大却极易配错。Istio 1.30 推出 Traff...

Rust 2025H2 项目目标收官:字段投影、BorrowSanitizer、Polonius 即将稳定

来源: blog.rust-lang.org 52
2025 下半年的 Rust 项目目标周期已经结束——41 个目标、13 个旗舰目标,从语言设计到编译器基础设施全面推进。不少目标将延续到 2026 周期,但有几个已经交出了阶段性答卷。本文挑出最值得关注的进展,逐个拆解。 字段投影(Field Projections)是本轮更新中信息量最大的目标。Benno Lossin 推动的 "virtual p...

Google Cloud Fraud Defense 登场:从验证码到全链路反欺诈的进化

来源: infoq.com 68
reCAPTCHA 那个"点选交通灯"的时代正在收尾。在 Next '26 大会上,Google 正式推出 Cloud Fraud Defense,定位为 reCAPTCHA 的继任产品——不再只盯着"你是不是机器人",而是把视野拉到整条业务链路上:登录、注册、支付,哪里有欺诈风险,哪里就有它的检测逻辑。 reCAPTCHA 的核心问题始终是:请求方是...