2026-09-10
来源: tech.meituan.com
27
Agent 不再只是“输入一句话、返回一段文本”的模型封装。它会规划任务、调用工具、读取外部数据,甚至根据中间结果修改行动路线。因此,只检查最终答案是否正确,已经无法回答几个关键问题:Agent 为什么成功、失败发生在哪一步、扩大流量后是否稳定,以及系统优化后是否真的变好。 《Agent 评测白皮书》系列围绕评测落地展开,规划为“评测全览、冷启动、扩量...
2026-09-03
来源: tech.meituan.com
27
数字人直播真正难的地方,不是让一个虚拟形象开口说话,而是让观众持续相信它“像一个人在直播”:外形稳定,动作自然,语音和画面同步,还要能够在大规模并发下稳定服务。美团智播围绕 AI 主播总结出一条完整链路:长得真、动得准、演得活、卖得好。 这条链路把数字人从单纯的展示技术,推进到可以服务实际经营的直播基础设施。 数字人的第一印象来自脸部、发型、服装和背景...
2026-08-27
来源: tech.meituan.com
29
ACL 2026 杰出论文奖公布后,全球共有 18 篇论文入选,其中包括美团履约技术团队的一项工作。GeoRA 关注的不是“如何把 LoRA 用到强化学习上”这么简单,而是一个更具体的问题:当模型通过可验证奖励进行训练时,传统低秩更新是否真的适合这种优化信号? 论文介绍了一种专为 RLVR(Reinforcement Learning with Ver...
2026-08-20
来源: tech.meituan.com
43
美团搜索 3.0 的一个重要方向,是把生成式大模型带来的语义理解能力,逐步转化为本地生活搜索排序可以稳定使用的信号。服务零售场景中的查询、商品、门店和用户意图往往表达不完整,单纯依赖关键词匹配容易错过真正相关的结果。LLM 语义表征提供了另一条路径:先把复杂文本映射为更有概括能力的向量或语义特征,再将这些信号交给排序模型学习。 这条路径并不是把一个大模...
2026-08-20
来源: tech.meituan.com
38
Agent 不只是生成一段文本。它会理解目标、规划步骤、调用工具、读取环境反馈,并在多轮交互中调整行为。这意味着,传统的大模型问答评测无法完整回答一个关键问题:这个 Agent 到底能不能稳定地完成业务任务? 一套可落地的 Agent 评测体系,需要把抽象的“效果好不好”拆成任务结果、过程质量、系统成本和安全边界,并让离线实验与线上真实反馈形成闭环。相...
2026-08-20
来源: tech.meituan.com
46
{"title_zh":"从推荐大模型到 DataAgents:KDD'26 美团论文与冠军思路的工程化解读","body_zh":"# 从推荐大模型到 DataAgents:KDD'26 美团论文与冠军思路的工程化解读\n\nKDD 2026 美团技术团队论文精选覆盖了推荐大模型、生成与奖励建模、智能体搜索、Transformer 框架和元泛化等方向...
2026-07-28
来源: tech.meituan.com
39
搭载美团 LongCat 2.0 的 CatPaw 正式上线。它关注的不只是让模型“跑得动”,而是把模型能力放进真实工作流程,进一步做到“用得好”。从已公布的信息看,CatPaw 同时提供开箱即用的 AI 智能工作台,以及面向企业的 Agent 开发与托管能力,覆盖个人提效和组织级智能化两类场景。 这两类能力看似都叫 Agent,落地方式却很不一样:个...
2026-07-27
来源: tech.meituan.com
47
许多多模态评测像一场开卷考试:模型看到一张图片,回答一个问题,几秒内结束。但真实世界并不会把所有条件整齐地摆在上下文里。智能体需要持续观察环境、记住早先发现的信息、识别隐藏的前置条件,并在行动失败后调整计划。美团 LongCat 团队构建的 MineExplorer,正是为了把评测从这种相对静态的“温室”搬到动态开放世界中。 MineExplorer ...
2026-07-27
来源: tech.meituan.com
46
过去一年,Search Agent 在 BrowseComp 等评测上的准确率从约 30% 快速提升到 90% 以上。这个数字说明模型进步很快,也暴露出一个评测难题:当大多数强模型都能取得高分,基准便难以继续区分它们的搜索、推理和证据组织能力。 美团开源 LoHoSearch,试图用知识图谱校准我们对搜索智能体能力的判断。它值得关注的不只是更难的题目,...
2026-07-13
来源: tech.meituan.com
47
2026 年,美团技术团队有数十篇论文被 ACL、SIGIR、ICML、KDD 等顶级会议收录,并从中精选 32 篇,通过 5 大专场进行直播讲解,其中还包括 ACL'26 杰出论文。对开发者而言,这批内容的价值不只是了解“又出现了哪些新模型”,更在于观察研究团队如何定义问题、设计实验,并把算法放进真实业务约束中验证。 不过,32 篇论文不适合按目录从...