2026-07-10
来源: aws.amazon.com
19
NVIDIA Nemotron 3 的定制不再意味着团队必须先搭建训练集群、编写分布式启动脚本,再长期维护 GPU 基础设施。Amazon SageMaker AI 的无服务器模型定制把更多资源调度工作交给平台,让开发者可以在 SageMaker Studio 中围绕数据集、微调策略和评估结果推进实验。真正需要工程团队把握的,是模型架构适配、训练数据质...
2026-07-10
来源: aws.amazon.com
35
牙科 X 光片的质量问题,往往要到医生查看或后续流程中才暴露。此时患者可能已经离开拍摄位置,重新拍摄会增加等待时间、操作成本和不必要的辐射暴露。Henry Schein One 构建的 Image Verify 将 AI 质量验证前移到影像采集时:系统基于 Amazon SageMaker AI 实时评估 X 光片,并把结果反馈给现场人员。 这套系统在...
2026-07-10
来源: aws.amazon.com
40
企业数据很少整齐地待在一个系统里:客户主数据和交易记录可能位于 Amazon Aurora,分析结果、行为指标又沉淀在 Amazon Redshift。传统客户 360 项目通常先复制数据、统一字段,再交给应用查询;这篇方案展示了另一条路径:让 Stardog 在两个数据源之上提供统一语义层,再由运行在 Amazon Bedrock AgentCore...
2026-07-10
来源: aws.amazon.com
21
智能体工作流进入企业生产环境后,难点很快会从“模型能否完成任务”转向“任务由谁负责、处理到哪一步、异常如何恢复、何时需要人工介入”。Amazon Quick Automate 的原生案件管理把每项业务工作包装成可跟踪的 case,并将创建、处理、人工审核和解决串成完整生命周期,使自动化能够从单次演示扩展到持续运行的企业流程。 普通自动化常把一次输入直接...
2026-07-10
来源: aws.amazon.com
42
模型完成量化,只解决了显存占用和推理成本的一部分问题。真正进入生产环境时,还要决定由谁管理实例、如何扩缩容、怎样接入现有容器平台,以及如何监控冷启动、显存和请求延迟。对于已经通过 Unsloth 量化的模型,可以根据团队现有基础设施,在 Amazon EC2、Amazon SageMaker AI 推理端点、Amazon EKS 和 Amazon EC...
2026-07-10
来源: aws.amazon.com
43
KTern.AI 从传统 SaaS 平台转向智能体 AI 平台时,面对的并不是简单地给产品接入一个大模型。SAP 转型项目往往持续数月甚至更久,涉及需求分析、流程设计、测试、迁移和上线等阶段。系统需要让多个专业智能体协同工作,同时保留持久上下文、限制工具权限,并达到企业生产环境要求的可靠性。 KTern.AI 选择 Amazon Bedrock Age...
2026-07-10
来源: aws.amazon.com
30
大模型在线推理并不是一种均匀的计算任务。Prefill 阶段需要并行处理整段输入,通常更依赖算力和显存带宽;Decode 阶段逐 token 生成结果,更看重低延迟、KV Cache 容量与持续调度能力。来源方案在 Amazon SageMaker HyperPod 上结合 vLLM 和 HyperPod Inference Operator,实现了 ...
2026-07-10
来源: infoq.com
27
Cloudflare 为自主 AI Agent 引入了临时账户:Agent 无需预先创建永久账户或完成常规身份认证,就能立即部署 Cloudflare Workers。临时账户如果没有被用户认领,会在 60 分钟后自动过期,其部署也随之失效。这项变化降低了“生成代码之后立刻运行”的门槛,同时把未认领资源的生命周期限制在一个明确的时间窗口内。 传统的代码...
2026-07-10
来源: pytorch.org
40
LayerNorm 和 RMSNorm 的浮点运算量并不算大,却经常成为模型推理与训练链路中的明显开销。问题通常不在算术,而在数据搬运:一个独立归一化算子需要读取输入、计算统计量、写回结果,后续 GEMM 或 Attention 又要重新读取这些结果。 本文讨论的优化方向,是把常见归一化操作融合进 GEMM 和 Attention 内核,让中间张量尽量...
2026-07-10
来源: infoq.com
28
Slack 工程团队提出了一种 Agentic Testing 思路:端到端测试不再完全依赖固定选择器和逐步脚本,而是让 AI Agent 根据测试意图观察界面、执行操作,并在运行时适应 UI 或系统变化。它瞄准的是分布式系统中长期存在的难题:页面只改了结构或文案,业务能力仍然正常,测试却先红了。 这并不意味着用 AI 替换所有自动化测试。更合理的定位...