标签

LLM

AI 正在重画岗位边界:从替代单项任务到扩展个人能力

来源: openai.com 27
关于 AI 与工作的讨论,常被压缩成一个问题:它会替代哪些岗位?新的 OpenAI 研究提供了另一个观察角度:ChatGPT 用户正在跨越原有角色分工,承担过去较少接触的任务。变化的重点不只是把现有工作做快,而是扩大一个人能够完成的任务范围,并由此重新塑造岗位边界。 来源摘要没有给出行业占比、效率增幅或因果关系,因此不能据此断言 AI 已经普遍提升生产...

DataBuff v0.1.5:写入性能升级后,如何验证 OTLP 链路是否真正受益

来源: oschina.net 25
DataBuff v0.1.5 的核心变化指向写入性能。该版本相对 v0.1.4 包含 25 个提交,继续围绕云原生与微服务场景完善其 AI Native OpenTelemetry APM 能力:通过 OTLP 接入遥测数据,以 Apache Doris 统一存储,并在 Web 端提供服务拓扑、Trace、指标和多 Agent 排障能力。 对于已经接...

当搜索评测不再拉开差距:LoHoSearch 如何用知识图谱重新校准智能体能力

来源: tech.meituan.com 23
过去一年,Search Agent 在 BrowseComp 等评测上的准确率从约 30% 快速提升到 90% 以上。这个数字说明模型进步很快,也暴露出一个评测难题:当大多数强模型都能取得高分,基准便难以继续区分它们的搜索、推理和证据组织能力。 美团开源 LoHoSearch,试图用知识图谱校准我们对搜索智能体能力的判断。它值得关注的不只是更难的题目,...

拆解前沿实验室智能体入侵:如何重建时间线、权限链与工具调用证据

来源: huggingface.co 13
来源标题将事件标记为“2026 年 7 月的前沿实验室智能体入侵”,但没有提供事件摘要、日志、受影响系统或处置结论。因此,本文不推测攻击者身份和具体入侵步骤,而是给出一套可落地的分析方法:面对具备模型推理、工具调用、长期凭证和外部连接能力的智能体系统,安全团队应如何重建技术时间线,并区分模型行为、控制平面操作与攻击者活动。 传统 Web 服务的调查通常...

ZGI 上线 Gitee:把 Agent 从演示原型带进可执行、可追踪的运行时

来源: oschina.net 23
创建一个能调用模型、工具和知识库的 Agent,通常只是工程的起点。进入真实环境后,团队还要回答一组更棘手的问题:任务由谁执行,失败后如何处理,运行过程怎样追踪,多个 Agent 又该如何统一管理。Agent Runtime 项目 ZGI 正式同步上线 Gitee,并开放源代码与部署文档,关注的正是 Agent 从 Demo 走向长期运行的这段距离。 ...

Postgres 激进特性为何应该先在分支版本中经受真实负载

来源: postgr.es 38
Postgres 的竞争力不只来自某项查询优化技术。对大量生产用户而言,更重要的是开源、没有厂商锁定、维护路径清晰,以及出现问题时总能找到理解内核的人。它未必在每种负载下都最聪明,但通常足够可靠、足够可预测。 这也解释了为什么一个看起来很有价值的新特性,很难直接进入 Postgres 核心。核心代码承载着关键业务数据,每增加一条执行路径,社区就要长期承...

从智能补全到数字员工:Coding Agent 真正要跨过的交付门槛

来源: oschina.net 27
很多团队已经习惯让 AI 补下一行代码、生成方法骨架或解释一个函数,但这些能力主要减少的是敲键盘的时间。SolonCode 所强调的方向更进一步:Coding Agent 不应只参与编码片段,而要围绕一个工程任务持续工作,直到产出可验证、可审查、可交接的结果。 这不是把补全窗口做得更大,而是把 AI 的工作单位从“代码片段”改成“任务交付”。 一个看似...

AI 根因分析的瓶颈,正在从模型推理转向上下文工程

来源: infoq.com 20
大模型用于根因分析(RCA)时,一个常见误区是把效果不佳归因于“模型不会推理”。越来越多工程师提出了另一种判断:现代 LLM 已经具备分析故障因果链的基本能力,真正困难的是在调用模型之前,把指标、日志、调用链、部署事件和服务依赖整理成一份准确、紧凑、带时间关系的上下文。 Coroot 针对 11 个模型开展的实验,为这一判断提供了早期证据。它并不意味着...

AI 根因分析的竞争焦点,正在从模型推理转向上下文工程

来源: infoq.com 30
现代大语言模型做根因分析时,真正的瓶颈可能已经不再是“模型会不会推理”,而是“系统能不能把正确的上下文送到模型面前”。当日志、指标、链路、变更记录和服务拓扑彼此割裂时,再强的模型也只能在不完整的证据上做猜测。 Coroot 围绕这一观点进行了覆盖 11 个模型的实验,为“模型已经具备相当的根因分析能力,工程难点转向遥测数据关联”提供了早期证据。这并不意...

在 Amazon Bedrock 上接入 Claude Opus 5:面向 Agent 与生产推理的工程实践

来源: aws.amazon.com 33
Claude Opus 5 的发布重点不只是模型能力提升,也包括如何把更强的 Opus 模型接入真实的 Agent 系统和生产推理流程。对于 AI 工程师来说,关键问题是如何在 Amazon Bedrock 上完成调用、控制延迟与成本,并让模型在多步骤任务中保持可观测、可恢复。 在 Agent 场景中,模型通常需要连续完成任务拆解、工具选择、结果判断和...