标签

LLM

别急着看工具排行榜:如何读懂 16893 次 Coding Agent 实战会话

来源: oschina.net 30
Claude Code、Codex 和 Cursor 究竟会选择哪些工具?一项实验把这个问题放进了 16893 次真实实现型会话中,覆盖 1163 个 prompt 变体、75 个代码仓库和 10 种语言。它的价值不只在于比较三个 coding agent,更在于展示:要研究 agent 的工程行为,不能只看一两个演示,也不能只让模型口头描述自己会怎么...

Solon AI 4.1 语义化聊天事件:别再把流式响应只当成 Token

来源: oschina.net 45
LLM 的流式接口早已不只是连续吐出文本。一次连接中可能交错出现正文、思考过程、工具参数、引用、媒体、安全事件、用量快照、状态变化和错误。Solon AI 4.1 对流式接口的调整,关键不在于换一个返回类型,而是把这些不同语义的数据从“部分 ChatResponse”中拆出来,让调用方按事件类型处理过程数据与最终结果。 把每一帧都包装成 ChatRes...

Covonaut v1.1.1:把 Go Agent 从循环代码推向生产级系统

来源: oschina.net 41
Go Agent 项目一旦进入生产环境,难点通常不在于调用一次模型,而在于如何管理上下文、工具失败、多个 Agent 协作、工作流状态和可观测性。Covonaut v1.1.1 延续了生产级 Go Agent 框架的定位,并重点优化了 TUI 库性能,让开发者可以在同一套体系中组合 Agent 循环、工具系统、MCP、多 Agent 协作和图式工作流。...

乌克兰独立新闻机构如何把 AI 变成韧性,而不是新的风险

来源: openai.com 33
OpenAI、AIRPPU 与 WAN-IFRA 联合发起了一项 AI 计划,目标是帮助乌克兰新闻机构增强创新能力、组织韧性与独立新闻实践。公告传递的重点不是用机器替代记者,而是让身处高压环境的编辑部获得更可持续的技术能力。 对新闻机构来说,引入 AI 的难点从来不只是模型效果。消息来源保护、事实核查、编辑责任、基础设施中断和供应商依赖,都会直接影响最...

Termexo V0.8.1:在手机浏览器里接管本地多 Agent 编程工作台

来源: oschina.net 45
Termexo V0.8.1 把“远程访问”带进了这套 Windows 本地多 Agent 工作台。用户在桌面端设置中开启功能后,同一局域网或 VPN 内的手机、平板和其他电脑,就能通过浏览器打开完整工作台,继续操作 Claude Code、Codex CLI、OpenCode 以及并行终端。 这次更新并不是简单增加一个移动端页面。Termexo 管理...

Google Mantis:用智能体闭环验证漏洞,减少 AI 扫描误报

来源: infoq.com 36
AI 可以快速找出代码中“看起来危险”的模式,但发现疑点并不等于确认漏洞。缺少可达性分析、运行时验证和稳定复现时,扫描结果很容易被误报与模型幻觉淹没。Google 开源的 Mantis 试图把 AI 从单纯的告警生成器变成执行漏洞生命周期的智能体框架,覆盖识别、验证、复现和修复。 传统扫描流程通常停在静态告警:某个输入可能未过滤、某个依赖版本可能受影响...

Google Mantis:用可复现证据压低 AI 漏洞扫描的误报率

来源: infoq.com 35
Google 开源了 Mantis,一个覆盖软件漏洞生命周期的 AI Agent 框架。它处理的不只是“发现可疑代码”,还包括验证漏洞、构造复现方式以及辅助修复。这个方向直指 AI 代码扫描的核心问题:模型能够生成大量看似合理的安全报告,但其中可能混有误报,甚至完全由幻觉产生的漏洞。 传统静态扫描器通常根据数据流、规则或模式输出告警。引入大模型后,扫描...

当 AI 成为“异质心智”:能力跃迁之后,如何把安全护栏做进系统

来源: openai.com 38
AI 的能力正在快速增强,但能力提升并不会自动带来可靠、可控或符合人类意图的行为。Jakub Pachocki 用“异质心智”提醒我们:面对越来越强的模型,不能只观察它在基准测试中答对了多少题,还要考虑它如何理解目标、利用工具,以及在陌生环境中采取什么行动。 这让对齐问题从一项模型研究任务,变成了完整的系统工程问题。更强的模型需要更严格的权限边界、持续...

编码智能体如何加速 AI 研究:从写代码到压缩实验闭环

来源: openai.com 33
OpenAI 内部的早期观察显示,编码智能体正在改变 AI 研究的工作方式:它们不仅补全代码,还能承担实现实验、运行测试、分析失败和准备后续修改等连续任务。真正值得关注的变化,不是单次生成了多少代码,而是研究人员能否用更短时间完成更多可靠的实验闭环。 来源摘要没有披露具体数值,因此本文不推断采用率或加速倍数,而是讨论这些早期信号背后的工程含义,以及团队...

Figma 如何用 AI Agent 将安全告警调查提速 70%

来源: infoq.com 46
安全告警调查很少只是“看一眼日志”。工程师往往要查询多个内部系统、翻阅相似事件、验证资产状态,再决定是否修复代码。Figma 的工程团队将这些重复步骤交给 AI Agent,并让它们利用历史调查经验辅助判断。据其工程实践总结,复杂告警的处理速度因此提升了约 70%。 这里真正值得关注的不是让模型代替安全工程师,而是把调查过程变成一条可调用工具、引用证据...