标签

AI

当搜索评测不再拉开差距:LoHoSearch 如何用知识图谱重新校准智能体能力

来源: tech.meituan.com 24
过去一年,Search Agent 在 BrowseComp 等评测上的准确率从约 30% 快速提升到 90% 以上。这个数字说明模型进步很快,也暴露出一个评测难题:当大多数强模型都能取得高分,基准便难以继续区分它们的搜索、推理和证据组织能力。 美团开源 LoHoSearch,试图用知识图谱校准我们对搜索智能体能力的判断。它值得关注的不只是更难的题目,...

拆解前沿实验室智能体入侵:如何重建时间线、权限链与工具调用证据

来源: huggingface.co 13
来源标题将事件标记为“2026 年 7 月的前沿实验室智能体入侵”,但没有提供事件摘要、日志、受影响系统或处置结论。因此,本文不推测攻击者身份和具体入侵步骤,而是给出一套可落地的分析方法:面对具备模型推理、工具调用、长期凭证和外部连接能力的智能体系统,安全团队应如何重建技术时间线,并区分模型行为、控制平面操作与攻击者活动。 传统 Web 服务的调查通常...

ZGI 上线 Gitee:把 Agent 从演示原型带进可执行、可追踪的运行时

来源: oschina.net 24
创建一个能调用模型、工具和知识库的 Agent,通常只是工程的起点。进入真实环境后,团队还要回答一组更棘手的问题:任务由谁执行,失败后如何处理,运行过程怎样追踪,多个 Agent 又该如何统一管理。Agent Runtime 项目 ZGI 正式同步上线 Gitee,并开放源代码与部署文档,关注的正是 Agent 从 Demo 走向长期运行的这段距离。 ...

PixelSmash:一个恶意视频如何借 FFmpeg MagicYUV 解码器攻击电脑

来源: infoq.com 20
JFrog Security Research 披露了 FFmpeg 媒体框架中的 PixelSmash 漏洞。问题位于 MagicYUV 解码器,可能导致远程代码执行(RCE)或拒绝服务(DoS),并且据披露已存在约十六年。攻击者不需要复杂的网络交互:只要让目标应用处理一个特制媒体文件,就可能触发漏洞。 真正需要关注的不只是 FFmpeg 命令行工具...

Postgres 激进特性为何应该先在分支版本中经受真实负载

来源: postgr.es 38
Postgres 的竞争力不只来自某项查询优化技术。对大量生产用户而言,更重要的是开源、没有厂商锁定、维护路径清晰,以及出现问题时总能找到理解内核的人。它未必在每种负载下都最聪明,但通常足够可靠、足够可预测。 这也解释了为什么一个看起来很有价值的新特性,很难直接进入 Postgres 核心。核心代码承载着关键业务数据,每增加一条执行路径,社区就要长期承...

从智能补全到数字员工:Coding Agent 真正要跨过的交付门槛

来源: oschina.net 28
很多团队已经习惯让 AI 补下一行代码、生成方法骨架或解释一个函数,但这些能力主要减少的是敲键盘的时间。SolonCode 所强调的方向更进一步:Coding Agent 不应只参与编码片段,而要围绕一个工程任务持续工作,直到产出可验证、可审查、可交接的结果。 这不是把补全窗口做得更大,而是把 AI 的工作单位从“代码片段”改成“任务交付”。 一个看似...

把 AI 接入 PostgreSQL 开发:从邮件线程分析到补丁审查

来源: postgr.es 36
一次面向 PostgreSQL 提交者与核心团队的 AI 工作坊,把讨论重点从“模型能回答什么”推进到了“模型如何参与真实的数据库工程”。三天的内容覆盖 Claude 命令行环境、自动化测试与基准测试、概念验证补丁,以及邮件线程分析和补丁审查。真正值得关注的不是生成代码本身,而是如何让 AI 在可验证、可回滚的边界内缩短调查周期。 数据库内核中的很多想...

AI 根因分析的瓶颈,正在从模型推理转向上下文工程

来源: infoq.com 21
大模型用于根因分析(RCA)时,一个常见误区是把效果不佳归因于“模型不会推理”。越来越多工程师提出了另一种判断:现代 LLM 已经具备分析故障因果链的基本能力,真正困难的是在调用模型之前,把指标、日志、调用链、部署事件和服务依赖整理成一份准确、紧凑、带时间关系的上下文。 Coroot 针对 11 个模型开展的实验,为这一判断提供了早期证据。它并不意味着...

AI 根因分析的竞争焦点,正在从模型推理转向上下文工程

来源: infoq.com 31
现代大语言模型做根因分析时,真正的瓶颈可能已经不再是“模型会不会推理”,而是“系统能不能把正确的上下文送到模型面前”。当日志、指标、链路、变更记录和服务拓扑彼此割裂时,再强的模型也只能在不完整的证据上做猜测。 Coroot 围绕这一观点进行了覆盖 11 个模型的实验,为“模型已经具备相当的根因分析能力,工程难点转向遥测数据关联”提供了早期证据。这并不意...