2026-07-24
来源: oschina.net
18
AI 编程 Agent 的账,往往不是写了多少行代码,而是读了多少遍代码。Stencil 的 Can Boluk 对 SWE-Bench 基准测试数据进行拆解后发现:在约 1.81 亿个 token、近 200 万次工具调用中,编辑和写入只占 9%,其余 91% 都消耗在读取文件、执行 grep、查看命令输出等活动上。 这改变了优化方向。提高生成速度只...
2026-07-24
来源: cncf.io
29
AI 应用正在从单轮生成式调用走向能够规划、调用工具并持续执行任务的 Agent。工作负载随之发生变化:推理请求持续时间更长,GPU 等加速资源更紧张,模型服务需要弹性伸缩,任务还可能跨越多个服务和集群。CNCF 日本社区成立 AI Infra SIG,并通过首次 meetup 和讲者招募启动交流,正是为了把这些问题放到 Kubernetes 与 Cl...
2026-07-24
来源: aws.amazon.com
18
代码助手面对的输入和输出与普通问答不同:提示词可能包含源代码、配置文件和内部接口信息,模型输出则可能直接进入代码评审、构建流水线甚至生产环境。Amazon Bedrock Guardrails 可以作为代码生成工作流中的独立安全层,用于拦截或标记不合规内容,同时帮助团队更准确地评估调用量、延迟和处理容量。 关键不在于“给模型加一个过滤器”,而在于把 G...
2026-07-24
来源: infoq.com
24
GitLost 是 Noma Security 发现的一类间接提示词注入攻击。攻击者把隐藏指令嵌入公开 GitHub Issue,诱导 GitHub 的 Agentic Workflows 读取这些不可信内容,并在后续执行中把私有仓库信息写入公开评论。问题不只是模型“听错了话”,而是自动化系统同时连接了不可信输入、敏感数据和公开输出。 传统 CI 通常...
2026-07-24
来源: blog.cloudflare.com
41
一个本应由边缘缓存直接返回的页面,有时会因为源站响应中的 或 被重新送回源站。麻烦在于,这些响应头可能来自旧框架、共享中间件或无法立即修改的托管服务。Cache Response Rules 提供了一个更合适的控制点:在响应进入缓存决策流程时修正这些头部,而不必先改造源站。 排查缓存未命中时,开发者通常先检查 URL、查询参数和缓存键。但缓存系统除了判...
2026-07-24
来源: azure.microsoft.com
27
AT&T 在开发 OTel2.0 的过程中处理了约一万亿个 Token。支撑这一规模的并非单一模型或单一 GPU,而是 Microsoft Foundry Managed Compute、开放模型,以及 AMD 和 NVIDIA GPU 基础设施组成的弹性计算体系。 这组信息揭示了大规模 AI 工程中的一个关键变化:当工作负载进入千亿乃至万亿 ...
2026-07-24
来源: pytorch.org
30
ML Kernel 的性能工作,常常被两件事绑住:一是要理解底层硬件的执行模型,二是同一算法换到另一种加速器后,往往又要重写一遍实现。Helion 是面向 PyTorch 的高层 DSL,目标是让开发者以更高层的方式编写性能可移植的 Kernel。现在,Helion 与 Google 合作构建了 TPU 后端,可将 Helion Kernel 编译到 ...
2026-07-24
来源: aws.amazon.com
37
AI Agent 上线后,真正棘手的问题不是“能不能回答”,而是错误能否被稳定复现、自动发现并阻止进入生产环境。Motorway 与 AWS 构建的端到端评估流水线,将错误结果从每 8 次查询约 1 次降到每 50 次约 1 次,同时把问题发现时间从数小时缩短到几分钟。其核心组合是 Strands Agents SDK 与 Amazon Bedrock...
2026-07-24
来源: cloud.google.com
34
大模型强化学习后训练并不总是缺 GPU,很多时候真正的问题是 GPU 已经分配,却在等待下一阶段。同步 RL 在 rollout 采样与梯度训练之间严格交替;异步 RL 虽然允许两者重叠,训练器仍可能因新鲜轨迹不足而停顿。llm-d 引入的协作式时间切片把这些阶段变成可调度单元,让多个独立 RL 作业共享同一组物理加速器。 初步基准显示,这种平台级复用...
2026-07-24
来源: aws.amazon.com
26
交易前台并不缺数据,真正稀缺的是把分散的数据、制度文档和操作工具快速组织成可执行判断的能力。Jefferies 构建的交易助手没有把大语言模型当作一个独立聊天窗口,而是基于 Strands Agents 编排基础模型与外部工具,并结合 Amazon Bedrock、Amazon Bedrock Knowledge Bases 和模型上下文协议(MCP)...