Netflix 式内部 LLM Serving:从模型接入到可靠推理平台
来源: netflixtechblog.com
48
把大语言模型接入公司内部系统,难点通常不在于启动一个推理进程,而在于让它像数据库、消息队列一样成为稳定的基础设施:调用方不必关心模型部署在哪里,平台团队能够控制成本、延迟和权限,业务团队也能持续替换模型而不重写应用。围绕 “In-House LLM Serving at Netflix” 这一主题,可以把内部 LLM Serving 理解为一套完整的平...