标签

LLM

从固定脚本到意图执行:Slack 的 Agent 驱动 E2E 测试思路

来源: infoq.com 31
Slack 工程团队提出了一种 Agentic Testing 思路:让 AI Agent 根据测试意图执行端到端工作流,而不是机械地重放一串固定选择器。它关注的不是“点击第三个按钮”,而是“完成登录并确认工作区首页可用”。当按钮位置、DOM 层级或部分文案变化时,Agent 可以在运行时重新判断下一步动作,从而降低 UI 自动化测试的脆弱性。 这并不...

用规格增强与 LLM 裁判构建可评估的智能体工作流

来源: realpython.com 41
现代智能体系统的问题往往不在于模型“不会回答”,而在于任务定义含糊、执行过程不可检查、最终结果缺少稳定的验收标准。围绕智能体架构的构建与评估,一个实用方向是把工作流拆成两类明确职责:先通过规格增强补全任务,再让独立的 LLM 裁判依据量表评估结果。 这不是简单地多调用几次模型。规格、执行和评审必须拥有清晰的数据边界,否则系统只是在反复生成措辞不同、质量...

Datadog 如何用 Claude、Cursor 与测试驱动方法迁移关键生产系统

来源: infoq.com 23
关键生产系统遇到存储后端的硬性限制时,迁移往往不是简单地替换客户端或复制数据。接口语义、历史边界条件、并发行为和性能特征都可能在切换过程中发生变化。Datadog 工程师 Arnold Wakim 分享的案例值得关注,原因不只是团队使用了 Claude 和 Cursor,而是他们把 AI 放进了一个由测试、性能数据和渐进式发布约束的生产迁移流程。 从来...

Datadog 如何用 Claude、Cursor 与测试驱动方式迁移关键生产系统

来源: infoq.com 31
当存储后端触及硬性上限时,团队面对的往往不是一次普通重构,而是一场必须保持线上行为稳定的系统迁移。Datadog 工程师 Arnold Wakim 分享的案例值得关注:团队借助 Claude 和 Cursor 推进关键生产系统演进,用测试约束 AI 生成的改动,在突破存储限制的同时显著改善性能。 来源摘要没有披露具体存储引擎、数据模型和性能数字,因此下...

从客服到网络运营:德国电信如何迈向 AI 原生运营商

来源: openai.com 29
德国电信正在与 OpenAI 合作,把 AI 从零散的聊天机器人扩展到客户服务、员工工作流、网络运营和语音交互。这种变化的关键不在于部署多少个模型,而在于能否把模型接入真实业务系统,并用权限、审计、评估和人工接管机制约束它。 电信运营商拥有大量跨系统流程:客服需要查询套餐、账单和故障记录;网络团队需要分析告警、变更和容量数据;员工则要在知识库、工单系统...

AgentTeams 与 AgentLoop:企业智能体落地开始补上“协作”和“观测”两块短板

来源: my.oschina.net 26
阿里云近期发布了两款面向企业 AI 落地的产品:AgentTeams 和 AgentLoop。前者聚焦多智能体协作治理,解决“多个智能体怎么有序配合完成复杂任务”;后者聚焦智能体观测与优化,解决“智能体上线后怎么发现问题、持续变好”。这两个方向很关键,因为企业真正部署智能体时,难点往往不在单次 Demo,而在流程、权限、质量和长期运营。 很多企业的第一...

用 PyTorch Profiler 拆解注意力计算:从算子耗时到显存峰值

来源: huggingface.co 36
注意力层经常同时承受计算、显存和数据搬运压力。只看一次前向传播的总耗时,很难判断瓶颈究竟来自矩阵乘法、Softmax、中间张量,还是内核调度。更有效的办法是用 PyTorch Profiler 把注意力计算拆到算子级,并结合输入形状、显存分配和执行时间做判断。 本文基于“分析 PyTorch 中的注意力计算”这一主题给出一套可直接实践的方法。由于来源摘...

Microsoft Foundry 进入生产级智能体阶段:前沿模型、亚太数据区与产品智能体

来源: azure.microsoft.com 29
Microsoft Foundry 此次更新把三项能力同时推向正式可用:OpenAI 最新前沿模型系列、Asia Pacific Data Zone,以及产品智能体能力。它们分别回应了生产系统最难处理的三个问题:模型能力是否足够、数据边界是否清晰、智能体能否真正接入业务流程。 这次变化的重点并不只是“多了一个模型”。当模型选择、区域治理和智能体运行能力...

PostgreSQL 做 AI 数据底座:用 C.A.L.M. 检查治理是不是真的落地

来源: postgr.es 24
企业 AI 治理最容易出问题的地方,往往不是模型团队写错了提示词,也不是合规团队没有流程,而是数据层和模型层之间的假设没人验证。数据工程、AI、平台、合规四个团队都在认真做事,但客户数据可能已经被复制到三套环境里:字段定义略有不同,访问控制略有不同,刷新频率也不同。模型层说“只给授权用户看”,数据层反问:“哪一份数据?按哪套权限?什么时候刷新?” 这正...

GPT-5.6 成为 Microsoft 365 Copilot 首选模型:办公 AI 的重心开始变了

来源: openai.com 22
Microsoft 365 Copilot 已将 GPT-5.6 作为首选模型,用来增强 Word、Excel、PowerPoint、Chat 和 Cowork 等场景里的 AI 能力。对开发者和企业技术团队来说,这不是单纯的“模型升级”新闻,而是一个信号:办公软件里的 AI 正在从辅助写几句话,转向跨文档、跨表格、跨协作流程的高质量工作流。 从来源摘...