标签

LLM

PB 级分片 Postgres 如何把备份时间压缩到小时级

来源: planetscale.com 43
当 Postgres 数据增长到 PB 级,并被拆分到大量分片后,备份不再是一条 命令能够解决的问题。PlanetScale 的实践表明,关键不是让单个备份任务跑得更快,而是把分片读取、对象存储上传和恢复校验拆成可水平扩展的并行流水线,再通过 WAL 重放把数据库推进到目标时间点。 大型备份通常同时消耗三类资源:数据库磁盘读取带宽、备份节点的 CPU ...

GenRec:如何把推荐系统改造成 LLM 原生架构

来源: netflixtechblog.com 60
“GenRec: Towards LLM-Native Recommendation at Netflix”这个标题指向了一种重要变化:大语言模型不再只是给传统推荐结果生成一句解释,而是开始进入推荐链路的核心,用统一的语言接口理解用户意图、组织候选内容,并输出可执行的推荐决策。 由于来源摘要没有披露 Netflix 的具体架构、模型或线上指标,下面不会...

Agentic AI 要走进生产环境,先把开放性与信任链补齐

来源: docker.com 61
Docker 加入 NVIDIA 的 Open Secure AI Alliance,目标是共同建设 Agentic AI 所需的安全、治理与信任框架。这件事的重要性不在于又多了一个行业联盟,而在于它直面了一个现实问题:当 AI 从“生成答案”升级为“调用工具并执行操作”,传统的应用安全边界已经不够用了。 普通聊天应用主要处理输入与输出,Agentic...

Percona Server for MongoDB 8.3 技术预览:用实验环境验证升级与搜索工作负载

来源: percona.com 59
Percona Server for MongoDB 8.3 已进入技术预览阶段。这不是一次面向生产集群的常规升级,而是给实验室、预发布集群和基准测试平台准备的早期版本。它尤其值得正在评估全文搜索、向量搜索等后续能力的团队关注,但现阶段的重点应是验证、测量和反馈,而不是承载真实业务流量。 技术预览版本允许开发者提前观察新版本在真实数据模型和工作负载下的...

把闲置时间变成容量:GKE 如何将单个 AI Agent 成本降低 75%

来源: cloud.google.com 46
AI Agent 的资源曲线通常不是平滑直线:它们会集中推理、调用工具或执行代码,随后等待用户输入和外部事件。如果每个 Agent 始终占用固定 CPU 和内存,大量预算最终会消耗在空闲时间上。 一次基于 GKE 节点和 OpenClaw 工作负载模型的测试展示了三层优化效果:从每个 Agent 独占 microVM,到使用 GKE Agent San...

AlloyDB IAM 组认证:用企业身份管住工程师与 AI Agent 的数据库访问

来源: cloud.google.com 35
数据库权限管理长期存在一个难解的规模问题:权限分得越细,账号开通、密码轮换、员工离职回收和审计的成本就越高;为了降低管理成本而共享高权限账号,又会扩大泄露影响范围,并让审计日志失去具体责任人。 AlloyDB 新增预览版 IAM 组认证后,企业可以把 Google Groups 映射到数据库访问策略。权限不再围绕数千个独立用户逐一配置,而是围绕财务分析...

FBTriton 如何在快速创新与上游 Triton 同步之间建立工程闭环

来源: pytorch.org 47
定制 GPU 编译器基础设施常见的难题,不是完成一次漂亮的优化,而是让优化在上游持续变化时仍然可用。Meta 的 FBTriton 一边承载 TLX、autoWS 等编译器创新,一边通过代理式上游摄取和分层的 L1/L2/L3 验证体系保持与 Triton 同步。真正值得借鉴的,是它把“跟进上游”从临时救火变成了一条可重复执行、可以逐层建立信心的工程流...

别让昂贵的 GPU 停在机坪上:从利用率监控到共享调度

来源: huggingface.co 31
GPU 集群越来越像航空公司的机队:采购只是开始,真正决定经济性的,是设备有多少时间在执行有效任务。已经分配却长期空闲的 GPU,就像停在机坪上的飞机,不但没有产出,还持续占用机位、电力、运维预算和折旧成本。 由于来源只给出了“空闲 GPU 如同停飞飞机”这一核心命题,下面不推断特定产品或原文数据,而是围绕这个命题给出一套可以落地的诊断与治理方法。 G...

开源依赖成为主战场:给软件供应链加上隔离、冷却与验证

来源: cloud.google.com 51
软件供应链攻击的重心正在发生变化。相比入侵大型软件厂商并篡改更新渠道,攻击者越来越多地盯上 npm、PyPI、Docker Hub、GitHub Actions 和开发者工具:接管维护者账号、投放恶意版本、利用安装脚本窃取凭据,再借助被盗令牌继续污染其他项目。 来源材料指出,2025 年至 2026 年上半年出现了一批规模显著扩大的开源供应链攻击,部分...

GPT-5.6 降价之后:如何把模型效率转化为企业级吞吐量

来源: openai.com 39
GPT-5.6 面向 Luna 和 Terra 的价格下调,真正值得关注的不只是单次调用变便宜,而是原本受预算限制的 AI 工作流开始具备规模化部署的空间。对企业团队来说,价格只是公式中的一个变量;延迟、输出长度、成功率、重试次数和人工复核成本,最终共同决定一项工作流是否划算。 当模型成本较高时,团队通常只把能力较强的模型放在少数关键节点,例如最终审核...