标签

机器学习

在 SageMaker HyperPod 上拆分大模型 Prefill 与 Decode:用 vLLM 构建可独立扩缩的推理链路

来源: aws.amazon.com 28
大模型在线推理并不是一种均匀的计算任务。Prefill 阶段需要并行处理整段输入,通常更依赖算力和显存带宽;Decode 阶段逐 token 生成结果,更看重低延迟、KV Cache 容量与持续调度能力。来源方案在 Amazon SageMaker HyperPod 上结合 vLLM 和 HyperPod Inference Operator,实现了 ...

把归一化塞进 GEMM 与 Attention:让 LayerNorm 和 RMSNorm 接近“免费”

来源: pytorch.org 38
LayerNorm 和 RMSNorm 的浮点运算量并不算大,却经常成为模型推理与训练链路中的明显开销。问题通常不在算术,而在数据搬运:一个独立归一化算子需要读取输入、计算统计量、写回结果,后续 GEMM 或 Attention 又要重新读取这些结果。 本文讨论的优化方向,是把常见归一化操作融合进 GEMM 和 Attention 内核,让中间张量尽量...

MCP 工具设计别只暴露接口:让 Agent 真能用起来

来源: aws.amazon.com 42
MCP 工具设计最容易出问题的地方,不是协议本身,而是把“给模型一个函数”误当成“模型能稳定完成任务”。工具名、参数形状、返回内容、错误信息、权限边界,都会直接影响 Agent 是否能做出正确决策。好的 MCP tool 设计,本质上是一次上下文工程:把模型需要的判断线索放在合适的位置,同时不要把业务系统的复杂度原封不动塞给它。 很多团队会把已有 RE...

SageMaker HyperPod 推理补齐企业级落地的五块拼图

来源: aws.amazon.com 29
SageMaker HyperPod inference 这次补上的不是单点性能优化,而是一组更接近企业生产环境的能力:数据留痕、模型来源、冷启动速度、域名接入和权限隔离。对负责大模型推理平台的团队来说,这些能力决定了服务能不能被审计、能不能快速上线、能不能稳定接入现有内部系统。 新增的 multi-tier data capture 面向两个常见诉求...

PyTorch 2.13:FlexAttention 登上 Apple Silicon,Mac 上的注意力实验更近一步

来源: pytorch.org 51
PyTorch 2.13 发布的一个关键信号是:FlexAttention 开始支持 Apple Silicon 上的 MPS 后端。对于在 MacBook、Mac Studio 上做模型原型、调试注意力机制或跑中小规模实验的开发者来说,这意味着部分原本更依赖 CUDA 环境的注意力优化路径,正在向本地 Apple GPU 迁移。 这不是“Mac 可以...

把知识图谱带进 RAG:GraphRAG 如何服务药物研发

来源: aws.amazon.com 37
药物研发里的问题很少是“找一段文字”这么简单。研究人员更常问:某个靶点和疾病有什么证据链?候选化合物影响哪些通路?这篇来源文章讨论的核心变化是:把图数据库、生成式 AI 和 BYOKG(Bring Your Own Knowledge Graph,自带知识图谱)结合起来,用 GraphRAG 加速科学发现,同时尽量不牺牲科学完整性。 传统 RAG 通常...

用 Amazon Bedrock 给邮箱自动分拣和排序

来源: aws.amazon.com 22
公共部门组织的邮箱常常不是“沟通工具”,而是事实上的业务入口:居民咨询、内部审批、供应商文件、紧急事件通报都会先进入共享邮箱。来源文章展示了一种用 Amazon Bedrock 驱动的生成式 AI 方案,把邮件自动分类、提取关键信息并按优先级排序,减少人工扫信箱的时间。 传统规则引擎适合处理明确模式,例如主题包含“发票”就打上财务标签,发件人来自某个域...

用 AWS WAF 守住 Amazon Bedrock AgentCore Runtime 的入口

来源: aws.amazon.com 34
Amazon Bedrock AgentCore Runtime 作为托管运行时,真正上线时绕不开一个问题:公网请求怎样进来,安全控制又怎样不被绕过?这篇方案的核心变化很明确:把入口收束到 internet-facing ALB,并在 ALB 前挂 AWS WAF,再通过 VPC Interface Endpoint 把流量送到 AgentCore R...