分类

文章

从万亿 Token 到生产落地:AT&T 如何构建可扩展的电信 AI 计算体系

来源: azure.microsoft.com 27
AT&T 在开发 OTel2.0 的过程中处理了约一万亿个 Token。支撑这一规模的并非单一模型或单一 GPU,而是 Microsoft Foundry Managed Compute、开放模型,以及 AMD 和 NVIDIA GPU 基础设施组成的弹性计算体系。 这组信息揭示了大规模 AI 工程中的一个关键变化:当工作负载进入千亿乃至万亿 ...

Helion 接入 TPU:用同一套高层 Kernel DSL 走向 Pallas

来源: pytorch.org 30
ML Kernel 的性能工作,常常被两件事绑住:一是要理解底层硬件的执行模型,二是同一算法换到另一种加速器后,往往又要重写一遍实现。Helion 是面向 PyTorch 的高层 DSL,目标是让开发者以更高层的方式编写性能可移植的 Kernel。现在,Helion 与 Google 合作构建了 TPU 后端,可将 Helion Kernel 编译到 ...

用 Strands 与 AgentCore 搭建可落地的 AI Agent 评估流水线

来源: aws.amazon.com 37
AI Agent 上线后,真正棘手的问题不是“能不能回答”,而是错误能否被稳定复现、自动发现并阻止进入生产环境。Motorway 与 AWS 构建的端到端评估流水线,将错误结果从每 8 次查询约 1 次降到每 50 次约 1 次,同时把问题发现时间从数小时缩短到几分钟。其核心组合是 Strands Agents SDK 与 Amazon Bedrock...

用协作式时间切片填平 RL 流水线的 GPU 空窗

来源: cloud.google.com 34
大模型强化学习后训练并不总是缺 GPU,很多时候真正的问题是 GPU 已经分配,却在等待下一阶段。同步 RL 在 rollout 采样与梯度训练之间严格交替;异步 RL 虽然允许两者重叠,训练器仍可能因新鲜轨迹不足而停顿。llm-d 引入的协作式时间切片把这些阶段变成可调度单元,让多个独立 RL 作业共享同一组物理加速器。 初步基准显示,这种平台级复用...

用 AI 构建交易助手:Jefferies 如何连接知识库、模型与前台工具

来源: aws.amazon.com 26
交易前台并不缺数据,真正稀缺的是把分散的数据、制度文档和操作工具快速组织成可执行判断的能力。Jefferies 构建的交易助手没有把大语言模型当作一个独立聊天窗口,而是基于 Strands Agents 编排基础模型与外部工具,并结合 Amazon Bedrock、Amazon Bedrock Knowledge Bases 和模型上下文协议(MCP)...

用 Highcharts 与 QuickSight 构建跨区域运营看板:统一视图不搬迁明细数据

来源: aws.amazon.com 21
跨区域分析经常遇到一个矛盾:管理团队希望在同一张图中比较各区域的承运商表现,安全与合规团队却要求数据留在原始 AWS 区域。借助 QuickSight 的联合数据集能力与 Highcharts 自定义可视化,可以把“数据驻留”和“统一展示”拆成两个问题处理,并绕开原生图表在复杂组合图、交互和格式控制方面的限制。 这类方案的关键不是把所有原始记录复制到一...

用 Amazon Bedrock AgentCore Optimization 发现生产环境中的静默智能体故障

来源: aws.amazon.com 25
AI 智能体最棘手的生产事故,往往不会触发传统告警:接口返回 200、延迟正常、模型成功生成内容,最终结果却是错的。Amazon Bedrock AgentCore optimization 关注的正是这类“静默失败”,通过跨会话发现、解释并排序行为失败模式,帮助团队优先修复影响最大的缺陷。 传统服务监控擅长回答这些问题: 请求是否成功返回? 响应时间...

让知识库先拆题再检索:Amazon Bedrock Agentic Retrieval 实战解析

来源: aws.amazon.com 37
传统 RAG 检索通常把用户问题编码成一个向量,再用它搜索知识库。这种方式处理单一事实问题很直接,但遇到包含多个约束、比较项或时间范围的复合问题时,一个查询向量很难同时准确表达所有意图。Amazon Bedrock Managed Knowledge Base 的 Agentic Retrieval 针对这一缺口,引入查询规划和流式执行,让检索过程能够...

智能体已经就位,但企业数据还没有:从记录系统走向行动系统

来源: cloud.google.com 22
企业把 AI 智能体推向生产时,真正卡住规模化的往往不是模型能力,而是数据能否提供可信的业务语境。智能体需要理解客户、订单、权限和业务规则,还要跨系统查询并执行操作。一次提示词就可能触发多轮检索、数据库查询和 API 调用,原本面向人工访问设计的数据平台,很容易在这种非线性负载下暴露延迟、成本和治理问题。 Google Cloud 在 Next 202...

Voicify 如何用 Gemini 把 AI 电话点餐做得更快、更准、更可靠

来源: cloud.google.com 32
餐厅电话一响,漏接可能意味着订单流失;医疗机构接到预约电话时,任何一个字段错误都可能影响后续服务。Voicify 的实践说明,企业级语音助手并不只是把大语言模型接到电话系统上,而是要同时解决交易准确性、流量尖峰、响应延迟以及安全合规问题。 Voicify 成立于 2018 年,最初希望为电话、聊天等渠道构建实用的语音驱动助手。疫情期间,团队将重点转向餐...