2026-05-29
来源: aws.amazon.com
47
你刚上线一个智能客服 Agent,头两周用户好评率 85%,第三周突然跌到 60%。你翻日志发现是新加的退款流程把对话搞乱了——但你改完代码后,怎么确认它真的修好了?下次再改,又怎么保证不踩同一个坑? 靠实时流量看指标是必要的,但实时数据本身在变:用户问题分布变了、业务规则变了、甚至模型版本变了。要判断"Agent 到底有没有进步",你还需要一块不动的...
2026-05-29
来源: aws.amazon.com
30
Anthropic 的 Claude Opus 4.8 现已在 AWS Amazon Bedrock 上正式可用。这次更新不只是"又多了一个模型选项"——Opus 4.8 在推理深度、指令遵循和长上下文处理上的改进,让它特别适合两类场景:需要多步决策的 agentic 系统,以及高吞吐的生产推理服务。对于在 Bedrock 上构建 AI 应用的工程师来...
2026-05-29
来源: aws.amazon.com
41
反洗钱(AML)审查是金融机构里最让人头疼的重复劳动之一。一笔可疑交易触发警报后,合规分析师要翻客户历史、比对交易模式、查关联账户、写调查报告——一个警报从打开到关闭,30 到 90 分钟是常态。警报量大、人力有限,积压成了日常。 Amazon Q Business 的 Flows 功能和 Snowflake Cortex AI 的组合,通过 MCP(...
2026-05-28
来源: aws.amazon.com
39
金融文档处理一直是企业数据管道中的硬骨头。银行流水格式各异、税表字段密集、合同条款嵌套复杂——传统 OCR 能拿到文字,却很难把"文字"变成结构化的"数据"。Amazon Bedrock Data Automation(BDA)针对这类场景提供了自定义提取能力,可以直接输出你关心的字段,而不是一整页原始文本。这篇文章聚焦它在四类常见金融文档上的实际表现...
2026-05-28
来源: aws.amazon.com
33
企业落地 AI Agent,最大的拦路虎不是模型能力,而是成本和运维复杂度。AWS 生成式 AI 创新中心(GenAIIC)与 Works Human Intelligence(WHI)的合作给出了一个相当硬核的答案:用 Amazon Bedrock AgentCore 搭建业务支持 Agent,成本降幅最高达 97%,同时运营效率显著提升。这篇文章拆...
2026-05-28
来源: aws.amazon.com
45
车队管理每天产生的数据量令人窒息——GPS 定位、油耗、驾驶行为、维保记录、路线偏离,一个中型车队一天就能堆出百万级事件。对运营人员来说,看仪表盘已经不够了,他们需要的是"下一步该做什么"。Verizon Connect 用 Agentic AI 把这个问题从"看数据"推进到"拿洞察",并把它稳定地推给了十万日活用户。这篇文章拆解他们走过的架构决策、实...
2026-05-28
来源: pytorch.org
28
给模型加上一行 ,推理速度有时能飙升数倍甚至十倍。这背后不是魔法,而是 GPU 执行模型的一个根本性优化——内核融合(Kernel Fusion)。理解它,你才能判断什么时候该用 compile、什么时候它帮不上忙,以及如何写出更容易被融合的代码。 PyTorch 的 eager 模式下,每遇到一个算子,框架就向 GPU 发射一个 kernel——一段...
2026-05-28
来源: aws.amazon.com
47
AWS 内部的 Sales, Marketing and Global Services(SMGS)组织每天要处理海量业务数据——销售管线、营销 ROI、全球服务工单,数据散落在数十个系统里。传统 BI 仪表盘能看数,但没法"对话"。SMGS 团队用 Amazon Bedrock AgentCore 搭了 NarrateAI,让业务人员直接用自然语言提...
2026-05-28
来源: aws.amazon.com
42
AWS 全球销售团队部署了超过 20 个领域专用 AI Agent——报价计算、客户画像、合同审查、竞品分析……每个 Agent 都能独立产出价值,但一线销售代表却要在不同系统间反复切换,自己判断"这个问题该找谁"。认知负荷没有减少,反而从"查资料"变成了"选 Agent"。Amazon Bedrock AgentCore 正是为解决这类编排问题而生:...
2026-05-27
来源: pytorch.org
43
大模型推理的瓶颈,很多时候不在算力,而在搬运。TokenSpeed 在 GPU 上跑 Qwen3.5-397B-A17B(397B 总参数、17B 活跃参数的 MoE 架构)冲到 580 tokens/s,核心思路就一条:系统性地消灭每一处不必要的内存拷贝。对做 Agentic 工作流的团队来说,这意味着长上下文、多轮工具调用的场景终于有了不卡顿的 G...