2026-09-12
来源: infoq.com
38
AWS 将 Lambda SnapStart 扩展到了容器镜像函数。这个变化解决了一个长期存在的打包取舍:Zip 部署包的体积上限更小,而容器镜像可以容纳更多依赖;但团队过去往往要在依赖空间和亚秒级启动之间做选择。 现在,使用容器镜像的 Lambda 函数也可以采用 SnapStart。对于依赖较多、又对启动延迟敏感的函数,这意味着不必仅为了满足 Zi...
2026-09-12
来源: aws.amazon.com
31
多 Agent 系统上线后,故障通常不只是“服务是否存活”。一个航空订票系统可能返回了 HTTP 200,却把乘客引导到错误的航班;某个 Agent 可能因为工具调用延迟变高而反复重试,最终拖慢整个预订流程。传统的 CPU、内存和错误率监控,很难回答这些问题。 这类系统需要两层监控:一层持续衡量 Agent 的回答质量和行为表现,另一层负责调查承载 A...
2026-09-12
来源: aws.amazon.com
38
在 Amazon Bedrock 上比较 OpenAI 模型时,只看每百万 Token 的单价,很容易得到一个看似精确、实际不够有用的结论。生产系统真正承担的成本,通常还包括重试、人工复核、工具调用、上下文长度,以及模型是否一次就能交付正确结果。 更可靠的评估方式,是把价格放回业务结果中:每个正确答案花了多少钱?一次 Agent 任务完整轨迹消耗了多少...
2026-09-12
来源: aws.amazon.com
30
MCP Apps 让模型调用工具的结果不再局限于纯文本。通过交互式 HTML widget,同一个 MCP Server 可以把表单、筛选器、图表或审批控件交给 AI Host 渲染,让用户直接在对话界面中完成操作。 这套能力的关键在于:MCP Apps 是与 Host 解耦的标准扩展。只要 ChatGPT、Claude 或其他 AI Host 支持对...
2026-09-11
来源: aws.amazon.com
37
需求预测真正难的地方,通常不是生成一个数字,而是把这个数字变成一张可解释、可校验、可追溯的采购订单。将 Amazon Chronos2 的零样本预测能力与 Amazon Bedrock AgentCore 的多智能体编排结合起来,可以搭建一条从历史销量到采购建议的自动化链路:不必为每个商品单独训练模型,同时把库存策略、供应商约束、审批规则和审计记录放进...
2026-09-11
来源: blog.cloudflare.com
37
SaaS 风险治理的难点,往往不在于发现问题,而在于发现之后能否及时处理。Cloudflare CASB 的自动修复策略把事件驱动逻辑直接放到 Cloudflare 开发者平台中,让安全团队可以针对高风险 SaaS 事件自动撤销文件共享,并通过 Webhook 通知其他系统,减少人工介入和风险暴露时间。 传统 CASB 流程通常是:扫描 SaaS 应用...
2026-09-11
来源: cloud.google.com
27
在 Goldman Sachs Communicopia & Technology Conference 上,Google Cloud CEO Thomas Kurian 更新了公司的云业务与 AI 战略。演讲释放出的重点并不只是某一个模型或产品,而是 Google Cloud 正试图把芯片、服务器、平台、模型和企业应用连接成一条完整的 AI ...
2026-09-11
来源: oschina.net
41
AIGCPanel v2.3.0 的关键变化,不是简单增加几个按钮,而是把原本只能在图形界面中操作的 AI 能力开放为 HTTP 接口。声音合成与克隆、口型同步数字人生成、25+ 音视频工具以及智能直播,因此可以被脚本、业务系统和自动化平台调用。与此同时,全工具支持中英双语切换,失败任务也可以继续执行,减少了长流程返工的成本。 图形界面适合人工试用和调...
2026-09-11
来源: aws.amazon.com
37
在大模型在线推理中,首 token 延迟往往比完整响应耗时更影响用户体验。Amazon SageMaker Inference 新增的前缀感知路由,会把共享相同提示词前缀的请求发送到同一个实例,让该实例上的 KV cache 更容易保持温热。 根据摘要中的 Llama 3.1 70B 基准测试,这种路由策略将 P50 time-to-first-tok...
2026-09-11
来源: aws.amazon.com
30
在大模型推理集群里,真正拖慢扩容的往往不是容器启动,而是模型权重和容器镜像的下载。Amazon SageMaker HyperPod 现在支持面向推理的模型缓存:提前把模型权重与容器镜像放到集群节点的本地 NVMe 存储中,Pod 启动时直接从本地读取,而不是重新通过网络下载。 这会把原本可能需要几十分钟的冷启动,压缩到秒级范围内。对于弹性扩容、故障替...