标签

工程

在 ZippyDB 前增加统一代理:ZGateway 带来的架构取舍

来源: engineering.fb.com 32
Meta 在其广泛使用的键值存储 ZippyDB 前部署了 ZGateway,用统一入口承接原本分散的访问流量。代理增加了一次网络跳转,却也提供了实施准入控制、负载均衡、跨地域容灾和统一运维的关键位置。 这类改造的价值不只是“隐藏后端地址”。真正重要的是把客户端难以一致实现的流量治理能力,从众多业务进程集中到一个可独立演进的数据面。 客户端直连存储节点...

组织的第二大脑:如何构建一个向专家学习的 AI

来源: engineering.fb.com 24
当关键知识只存在于少数专家的经验、判断和口头解释中,组织就很难稳定地复用这些能力。一个面向特定领域的 AI agent 可以承担“第二专家”的角色:让更多人随时访问专业知识,也让专家经验得到保存、审计和持续迭代。 这类系统的重点不只是接入一个大模型,而是把专家知识组织成可追溯的结构,并把专家参与学习的过程纳入系统工作流。 普通的领域 agent 往往围...

MetaRoCE:为大规模 AI 集群重做 RDMA 以太网传输

来源: engineering.fb.com 40
训练和推理前沿模型时,GPU 之间的数据交换往往比单卡算力更早成为瓶颈。集体通信、参数同步和专家路由都要求网络以极低延迟稳定传输数据;一旦拥塞、丢包恢复或协议开销处理不当,昂贵的 GPU 就会等待网络。 Meta 公布的 MetaRoCE 是一套面向 AI 工作负载、基于通用以太网的全新 RDMA 传输协议。除规范外,项目还发布了参考软件实现与合规测试...

MTIA 300:把网络通信做到训练芯片里的推荐模型加速器

来源: engineering.fb.com 47
训练排序与推荐模型时,算力并不是唯一的瓶颈。大规模稀疏特征、嵌入表分片和频繁的集体通信,会让加速器长期等待数据到位。Meta 公布的 MTIA 300 面向这一类训练与推理负载,其关键变化是将 NIC chiplet 与通信卸载引擎直接集成进芯片,并与 HCCL 通信库协同设计。 这意味着,系统不再完全依赖通用 GPU 加上外置网络设备来完成通信路径。...

从用户行为序列到规模定律:广告排序系统的多阶段架构

来源: engineering.fb.com 59
当推荐系统每天处理数十亿次用户互动时,用户刚刚看过什么、点击过什么、停留了多久,以及这些行为发生的先后顺序,往往比一组静态标签更能说明当前意图。Meta 关于广告排序的最新实践,将讨论重点从“如何加入序列特征”推进到了“如何让序列建模在大规模系统中持续扩展”:模型结构、数据处理和计算预算需要一起设计。 传统广告排序系统通常依赖稀疏特征,例如用户兴趣标签...

Meta GEM 训练扩展到数千张 GPU:四倍算力规模下如何把 MFU 提升到 20%–25%

来源: engineering.fb.com 64
Meta 的生成式广告推荐模型 GEM,是 Instagram 和 Facebook 广告推荐背后的基础模型。它的训练已经进入 LLM 规模:使用数千张最新一代 GPU,并在训练 FLOPs 扩大 4 倍的同时,将端到端训练效率提高一倍,使模型 FLOPs 利用率(Model FLOPs Utilization,MFU)达到 20%–25%。 这组数字...

用分层兴趣表示连接用户与广告实体:深层漏斗优化的工程思路

来源: engineering.fb.com 44
Meta 正在研究一种用于广告深层漏斗优化的上游表示层:在用户、广告主、商品和服务等广告实体之上学习统一嵌入,把用户推断出的兴趣与广告主提供的内容连接起来。这里的关键变化不是再增加一个独立排序模型,而是尝试提供一套可以被多个下游任务复用的兴趣表示。 广告系统中的兴趣通常不处于同一个粒度。一个用户可能对“运动”有长期偏好,近期在浏览“户外运动”,当前又集...

用 sched_ext 为广告服务定制 Linux 调度策略:从内核升级风险到毫秒级延迟治理

来源: engineering.fb.com 57
在大规模广告投放系统中,几毫秒并不是可以忽略的噪声。请求往往要经过召回、排序、预算控制和竞价等多个阶段,调度延迟一旦出现在高分位,就可能直接影响广告服务的吞吐、超时率和业务效果。Meta 面临 Linux 内核升级可能引入延迟回退的问题时,选择了上游 Linux 的 :一个基于 BPF 的可扩展调度框架,用它构建适合广告投放工作负载的调度策略。 广告服...

Meta 规模下的 AI 存储蓝图:训练速度背后的数据通道

来源: engineering.fb.com 57
过去几年,模型能力和训练数据规模都在快速膨胀。更明显的变化是,新一代前沿模型发布间隔从几个月压缩到几周。这个节奏背后不只是 GPU 数量的问题,存储也会直接决定训练吞吐、作业等待时间和算力浪费。对 AI 基础设施来说,存储已经从“放数据的地方”变成了训练流水线的一部分。 大模型训练不是一次性把数据读进内存就结束。训练集、检查点、日志、特征缓存、评估数据...

Meta 连续十年赞助 PSF:Python 为什么仍是工程栈里的硬通货

来源: engineering.fb.com 42
Meta 连续第十年赞助 Python Software Foundation(PSF)。这件事不只是一次企业公益露出,它更像一个信号:Python 仍然是大型工程组织愿意长期投入的基础设施。对于每天写服务、跑数据、做自动化和搭建 AI 工具的开发者来说,语言生态的健康程度,和语法本身一样重要。 PSF 是支撑 Python 语言和社区的非营利组织。它...