标签

工程实践

从结果到轨迹:搭建一套可落地的 Agent 评测体系

来源: tech.meituan.com 27
Agent 不再只是“输入一句话、返回一段文本”的模型封装。它会规划任务、调用工具、读取外部数据,甚至根据中间结果修改行动路线。因此,只检查最终答案是否正确,已经无法回答几个关键问题:Agent 为什么成功、失败发生在哪一步、扩大流量后是否稳定,以及系统优化后是否真的变好。 《Agent 评测白皮书》系列围绕评测落地展开,规划为“评测全览、冷启动、扩量...

从“像真人”到“卖得好”:美团智播数字人直播的技术闭环

来源: tech.meituan.com 27
数字人直播真正难的地方,不是让一个虚拟形象开口说话,而是让观众持续相信它“像一个人在直播”:外形稳定,动作自然,语音和画面同步,还要能够在大规模并发下稳定服务。美团智播围绕 AI 主播总结出一条完整链路:长得真、动得准、演得活、卖得好。 这条链路把数字人从单纯的展示技术,推进到可以服务实际经营的直播基础设施。 数字人的第一印象来自脸部、发型、服装和背景...

GeoRA:为什么 RLVR 需要一套重新设计的 LoRA

来源: tech.meituan.com 29
ACL 2026 杰出论文奖公布后,全球共有 18 篇论文入选,其中包括美团履约技术团队的一项工作。GeoRA 关注的不是“如何把 LoRA 用到强化学习上”这么简单,而是一个更具体的问题:当模型通过可验证奖励进行训练时,传统低秩更新是否真的适合这种优化信号? 论文介绍了一种专为 RLVR(Reinforcement Learning with Ver...

Project Lighthouse 第三部分:用 project-lighthouse-anonymize 让数据脱敏可验证

来源: medium.com 41
当一个项目需要处理日志、工单、测试数据或用户反馈时,“把敏感字段删掉”通常只是起点。真正困难的是:哪些字段需要保护,脱敏后是否还能用于调试,以及团队能否稳定地重复这套处理流程。Project Lighthouse 的第三部分引入 ,主题可以概括为把匿名化从一次性的脚本动作,变成可审查、可测试、可接入流水线的工程能力。 删除邮箱、手机号和身份证号,确实能...

从单点验证到跨场景复用:LLM 语义表征如何进入搜索排序

来源: tech.meituan.com 43
美团搜索 3.0 的一个重要方向,是把生成式大模型带来的语义理解能力,逐步转化为本地生活搜索排序可以稳定使用的信号。服务零售场景中的查询、商品、门店和用户意图往往表达不完整,单纯依赖关键词匹配容易错过真正相关的结果。LLM 语义表征提供了另一条路径:先把复杂文本映射为更有概括能力的向量或语义特征,再将这些信号交给排序模型学习。 这条路径并不是把一个大模...

从任务成功率到线上闭环:如何建立可落地的 Agent 评测体系

来源: tech.meituan.com 38
Agent 不只是生成一段文本。它会理解目标、规划步骤、调用工具、读取环境反馈,并在多轮交互中调整行为。这意味着,传统的大模型问答评测无法完整回答一个关键问题:这个 Agent 到底能不能稳定地完成业务任务? 一套可落地的 Agent 评测体系,需要把抽象的“效果好不好”拆成任务结果、过程质量、系统成本和安全边界,并让离线实验与线上真实反馈形成闭环。相...

KDD'26美团学术论文精选及KDD Cup'26 DataAgents赛道冠军思路解读

来源: tech.meituan.com 46
{"title_zh":"从推荐大模型到 DataAgents:KDD'26 美团论文与冠军思路的工程化解读","body_zh":"# 从推荐大模型到 DataAgents:KDD'26 美团论文与冠军思路的工程化解读\n\nKDD 2026 美团技术团队论文精选覆盖了推荐大模型、生成与奖励建模、智能体搜索、Transformer 框架和元泛化等方向...

当模型终于学会放下疫情:我们如何判断 COVID-19 已经结束

来源: medium.com 47
判断 COVID-19 是否“结束”,并不只是看某一天的感染人数下降。更难的问题是:当世界的行为、数据分布和风险结构都发生变化后,过去训练出来的模型是否仍然在描述现实。 这个问题的关键不在于模型还能不能预测,而在于它是否还在用已经失效的经验预测。疫情期间形成的数据规律可能来自封控、口罩、检测政策、就医行为和媒体关注度。当这些条件改变,模型就必须学会放下...

用评测驱动生成式 AI 开发:从实验原型走向规模化交付

来源: medium.com 43
生成式 AI 应用最危险的阶段,往往不是模型完全不可用,而是演示效果不错、上线后却无法稳定回答真实问题。传统软件可以用确定性断言判断对错,LLM 输出则同时受到提示词、模型版本、采样参数、上下文和外部工具影响。要控制这种不确定性,评测不能等到发布前才补做,而应成为需求、开发、发布和线上监控共同依赖的工程基础。 由于来源摘要未提供具体实验数据,下面不把任...

CatPaw 正式上线:从 AI 工作台到企业级 Agent 托管,如何真正落地

来源: tech.meituan.com 39
搭载美团 LongCat 2.0 的 CatPaw 正式上线。它关注的不只是让模型“跑得动”,而是把模型能力放进真实工作流程,进一步做到“用得好”。从已公布的信息看,CatPaw 同时提供开箱即用的 AI 智能工作台,以及面向企业的 Agent 开发与托管能力,覆盖个人提效和组织级智能化两类场景。 这两类能力看似都叫 Agent,落地方式却很不一样:个...