2026-07-10
来源: aws.amazon.com
43
大模型在线推理并不是一种均匀的计算任务。Prefill 阶段需要并行处理整段输入,通常更依赖算力和显存带宽;Decode 阶段逐 token 生成结果,更看重低延迟、KV Cache 容量与持续调度能力。来源方案在 Amazon SageMaker HyperPod 上结合 vLLM 和 HyperPod Inference Operator,实现了 ...
2026-07-10
来源: infoq.com
43
Cloudflare 为自主 AI Agent 引入了临时账户:Agent 无需预先创建永久账户或完成常规身份认证,就能立即部署 Cloudflare Workers。临时账户如果没有被用户认领,会在 60 分钟后自动过期,其部署也随之失效。这项变化降低了“生成代码之后立刻运行”的门槛,同时把未认领资源的生命周期限制在一个明确的时间窗口内。 传统的代码...
2026-07-10
来源: infoq.com
38
Slack 工程团队提出了一种 Agentic Testing 思路:端到端测试不再完全依赖固定选择器和逐步脚本,而是让 AI Agent 根据测试意图观察界面、执行操作,并在运行时适应 UI 或系统变化。它瞄准的是分布式系统中长期存在的难题:页面只改了结构或文案,业务能力仍然正常,测试却先红了。 这并不意味着用 AI 替换所有自动化测试。更合理的定位...
2026-07-10
来源: infoq.com
42
Slack 工程团队提出了一种 Agentic Testing 思路:让 AI Agent 根据测试意图执行端到端工作流,而不是机械地重放一串固定选择器。它关注的不是“点击第三个按钮”,而是“完成登录并确认工作区首页可用”。当按钮位置、DOM 层级或部分文案变化时,Agent 可以在运行时重新判断下一步动作,从而降低 UI 自动化测试的脆弱性。 这并不...
2026-07-10
来源: realpython.com
53
现代智能体系统的问题往往不在于模型“不会回答”,而在于任务定义含糊、执行过程不可检查、最终结果缺少稳定的验收标准。围绕智能体架构的构建与评估,一个实用方向是把工作流拆成两类明确职责:先通过规格增强补全任务,再让独立的 LLM 裁判依据量表评估结果。 这不是简单地多调用几次模型。规格、执行和评审必须拥有清晰的数据边界,否则系统只是在反复生成措辞不同、质量...
2026-07-10
来源: infoq.com
34
关键生产系统遇到存储后端的硬性限制时,迁移往往不是简单地替换客户端或复制数据。接口语义、历史边界条件、并发行为和性能特征都可能在切换过程中发生变化。Datadog 工程师 Arnold Wakim 分享的案例值得关注,原因不只是团队使用了 Claude 和 Cursor,而是他们把 AI 放进了一个由测试、性能数据和渐进式发布约束的生产迁移流程。 从来...
2026-07-10
来源: infoq.com
40
当存储后端触及硬性上限时,团队面对的往往不是一次普通重构,而是一场必须保持线上行为稳定的系统迁移。Datadog 工程师 Arnold Wakim 分享的案例值得关注:团队借助 Claude 和 Cursor 推进关键生产系统演进,用测试约束 AI 生成的改动,在突破存储限制的同时显著改善性能。 来源摘要没有披露具体存储引擎、数据模型和性能数字,因此下...
2026-07-10
来源: openai.com
41
德国电信正在与 OpenAI 合作,把 AI 从零散的聊天机器人扩展到客户服务、员工工作流、网络运营和语音交互。这种变化的关键不在于部署多少个模型,而在于能否把模型接入真实业务系统,并用权限、审计、评估和人工接管机制约束它。 电信运营商拥有大量跨系统流程:客服需要查询套餐、账单和故障记录;网络团队需要分析告警、变更和容量数据;员工则要在知识库、工单系统...
2026-07-10
来源: my.oschina.net
42
阿里云近期发布了两款面向企业 AI 落地的产品:AgentTeams 和 AgentLoop。前者聚焦多智能体协作治理,解决“多个智能体怎么有序配合完成复杂任务”;后者聚焦智能体观测与优化,解决“智能体上线后怎么发现问题、持续变好”。这两个方向很关键,因为企业真正部署智能体时,难点往往不在单次 Demo,而在流程、权限、质量和长期运营。 很多企业的第一...
2026-07-10
来源: huggingface.co
49
注意力层经常同时承受计算、显存和数据搬运压力。只看一次前向传播的总耗时,很难判断瓶颈究竟来自矩阵乘法、Softmax、中间张量,还是内核调度。更有效的办法是用 PyTorch Profiler 把注意力计算拆到算子级,并结合输入形状、显存分配和执行时间做判断。 本文基于“分析 PyTorch 中的注意力计算”这一主题给出一套可直接实践的方法。由于来源摘...