2026-07-27
来源: tech.meituan.com
24
过去一年,Search Agent 在 BrowseComp 等评测上的准确率从约 30% 快速提升到 90% 以上。这个数字说明模型进步很快,也暴露出一个评测难题:当大多数强模型都能取得高分,基准便难以继续区分它们的搜索、推理和证据组织能力。 美团开源 LoHoSearch,试图用知识图谱校准我们对搜索智能体能力的判断。它值得关注的不只是更难的题目,...
2026-07-27
来源: spring.io
30
{"title_zh":"从 Docker Compose 到 Testcontainers:让 Spring 开发环境与集成测试使用同一套基础设施","body_zh":"# 从 Docker Compose 到 Testcontainers:让 Spring 开发环境与集成测试使用同一套基础设施\n\nDocker、Compose 与 Testco...
2026-07-27
来源: huggingface.co
13
来源标题将事件标记为“2026 年 7 月的前沿实验室智能体入侵”,但没有提供事件摘要、日志、受影响系统或处置结论。因此,本文不推测攻击者身份和具体入侵步骤,而是给出一套可落地的分析方法:面对具备模型推理、工具调用、长期凭证和外部连接能力的智能体系统,安全团队应如何重建技术时间线,并区分模型行为、控制平面操作与攻击者活动。 传统 Web 服务的调查通常...
2026-07-26
来源: oschina.net
24
创建一个能调用模型、工具和知识库的 Agent,通常只是工程的起点。进入真实环境后,团队还要回答一组更棘手的问题:任务由谁执行,失败后如何处理,运行过程怎样追踪,多个 Agent 又该如何统一管理。Agent Runtime 项目 ZGI 正式同步上线 Gitee,并开放源代码与部署文档,关注的正是 Agent 从 Demo 走向长期运行的这段距离。 ...
2026-07-26
来源: infoq.com
20
JFrog Security Research 披露了 FFmpeg 媒体框架中的 PixelSmash 漏洞。问题位于 MagicYUV 解码器,可能导致远程代码执行(RCE)或拒绝服务(DoS),并且据披露已存在约十六年。攻击者不需要复杂的网络交互:只要让目标应用处理一个特制媒体文件,就可能触发漏洞。 真正需要关注的不只是 FFmpeg 命令行工具...
2026-07-26
来源: postgr.es
38
Postgres 的竞争力不只来自某项查询优化技术。对大量生产用户而言,更重要的是开源、没有厂商锁定、维护路径清晰,以及出现问题时总能找到理解内核的人。它未必在每种负载下都最聪明,但通常足够可靠、足够可预测。 这也解释了为什么一个看起来很有价值的新特性,很难直接进入 Postgres 核心。核心代码承载着关键业务数据,每增加一条执行路径,社区就要长期承...
2026-07-26
来源: oschina.net
28
很多团队已经习惯让 AI 补下一行代码、生成方法骨架或解释一个函数,但这些能力主要减少的是敲键盘的时间。SolonCode 所强调的方向更进一步:Coding Agent 不应只参与编码片段,而要围绕一个工程任务持续工作,直到产出可验证、可审查、可交接的结果。 这不是把补全窗口做得更大,而是把 AI 的工作单位从“代码片段”改成“任务交付”。 一个看似...
2026-07-26
来源: postgr.es
36
一次面向 PostgreSQL 提交者与核心团队的 AI 工作坊,把讨论重点从“模型能回答什么”推进到了“模型如何参与真实的数据库工程”。三天的内容覆盖 Claude 命令行环境、自动化测试与基准测试、概念验证补丁,以及邮件线程分析和补丁审查。真正值得关注的不是生成代码本身,而是如何让 AI 在可验证、可回滚的边界内缩短调查周期。 数据库内核中的很多想...
2026-07-25
来源: infoq.com
21
大模型用于根因分析(RCA)时,一个常见误区是把效果不佳归因于“模型不会推理”。越来越多工程师提出了另一种判断:现代 LLM 已经具备分析故障因果链的基本能力,真正困难的是在调用模型之前,把指标、日志、调用链、部署事件和服务依赖整理成一份准确、紧凑、带时间关系的上下文。 Coroot 针对 11 个模型开展的实验,为这一判断提供了早期证据。它并不意味着...
2026-07-25
来源: infoq.com
31
现代大语言模型做根因分析时,真正的瓶颈可能已经不再是“模型会不会推理”,而是“系统能不能把正确的上下文送到模型面前”。当日志、指标、链路、变更记录和服务拓扑彼此割裂时,再强的模型也只能在不完整的证据上做猜测。 Coroot 围绕这一观点进行了覆盖 11 个模型的实验,为“模型已经具备相当的根因分析能力,工程难点转向遥测数据关联”提供了早期证据。这并不意...