来源: aws.amazon.com
153
当你把一个 70B 甚至 175B 参数的大模型往 GPU HBM 里塞的时候,等待时间会随参数量线性膨胀——几百 GB 的权重文件先从存储读到 CPU 内存,再从 CPU 内存拷贝到 GPU,整个过程 GPU 干等着,推理启动慢、资源浪费大。AWS 近期把 GPUDirect Storage(GDS)与 Amazon FSx for Lustre 打...
来源: aws.amazon.com
30
时序数据从来都不缺——金融行情、IoT 传感器、DevOps 指标,每秒都在涌入。缺的是让业务人员自己拿到答案的能力。分析师想问"过去 24 小时这只股票的波动率是多少",要么等数据团队排期写 SQL/Q 查询,要么在仪表盘里翻半天。Amazon QuickSight 搭上 KDB-X 的 MCP Server,把这条链路压成一句话:用自然语言提问,直...
来源: openai.com
33
OpenAI 的前沿模型(GPT-4o、o3、o4-mini 等)和代码执行代理 Codex 终于在 AWS 上正式可用(GA)。这意味着企业不再需要绕开现有的 AWS 账户体系、安全策略和采购流程去单独对接 OpenAI——直接在熟悉的 AWS 环境里调用即可,从评估到上线的路径大幅缩短。 过去一年,不少企业在用 OpenAI 模型时遇到一个尴尬局面...
来源: infoq.com
33
一家金融科技公司的 API 网关上,Lambda authorizer 挡住了所有未授权请求——直到有人在 URL 末尾随手加了一个 。这个看似无害的字符,让整条鉴权链路直接失效,未认证用户得以发起电汇操作。这不是科幻情节,而是真实发生的安全事件。更值得关注的是,同一类路径规范化不匹配的漏洞也出现在 gRPC-Go 中(CVE-2026-33186),...
来源: infoq.com
47
一家托管了三百万用户工作负载的平台,被自家云厂商的自动化系统一键拔线——没有预警,没有人工确认,连邮件通知都是事后才到。这就是 Railway 在 Google Cloud 上遭遇的真实事故:GCP 的自动化风控系统直接冻结了 Railway 的生产账号,导致整个平台瘫痪八小时,而受影响的不仅是 GCP 上的工作负载,连部署在 AWS 和裸金属服务器上...
来源: aws.amazon.com
39
大模型上线推理后,运维团队最怕的不是"模型不跑",而是"模型跑着但悄悄变差"。传统监控只盯着 GPU 利用率、请求延迟这些基础设施指标,对 LLM 输出质量——延迟首字时间(TTFT)、吞吐量(Tokens/s)、输出截断率——几乎一无所知。Amazon SageMaker AI 的 Inference Component 架构配合 CloudWatc...
来源: postgr.es
42
大多数 PostgreSQL 大会的参会者以用户和 DBA 为主——听演讲、学调优、拿最佳实践回家。PGConf.dev 不一样。它吸引的是贡献者和社区核心成员,这意味着你带着 Patch 去现场,真的有人坐下来帮你 Review。 Robert Haas 负责组织周二的内容,横跨六个 Track。六轨意味着同一时段有六场不同方向的深度分享并行进行——...
来源: aws.amazon.com
51
阿塞拜疆语属于突厥语族,一个词通过后缀叠加可以表达英语整句话的含义——名词有 18 种格变,动词时态与人称通过层层黏着完成。这种"形态丰富"(morphologically rich)的语言对大模型来说意味着两件事:词表膨胀极快,训练数据却极其稀缺。Azercell 作为阿塞拜疆最大电信运营商,需要在六周内从零搭建一套生产级训练框架,把通用基础模型改造...
来源: aws.amazon.com
44
SageMaker AI 现在支持托管 MLflow Server,但默认的访问方式要么走 SageMaker Studio 内部,要么依赖 AWS IAM 策略直接暴露端点——两者都不适合直接面向团队内部的非 AWS 用户。这篇文章给出了一套完整方案:React 前端嵌入 MLflow UI,Flask 反向代理自动签注 SigV4 请求,整栈用 C...
来源: aws.amazon.com
40
很多团队在向云迁移的过程中,都会碰到一个现实问题:本地训练脚本、调度系统、监控面板已经围绕 MLflow 搭好了整套流程,但一旦把实验追踪服务搬到 Amazon SageMaker MLflow,外部系统就得装 MLflow SDK、配 VPC 网络才能连上——这对还在过渡期的组织来说改动面太大。AWS 最近给出的方案是:在 SageMaker MLf...