标签

美团

CatPaw 正式上线:从 AI 工作台到企业级 Agent 托管,如何真正落地

来源: tech.meituan.com 19
搭载美团 LongCat 2.0 的 CatPaw 正式上线。它关注的不只是让模型“跑得动”,而是把模型能力放进真实工作流程,进一步做到“用得好”。从已公布的信息看,CatPaw 同时提供开箱即用的 AI 智能工作台,以及面向企业的 Agent 开发与托管能力,覆盖个人提效和组织级智能化两类场景。 这两类能力看似都叫 Agent,落地方式却很不一样:个...

MineExplorer:把多模态大模型放进开放世界,重新检验长程规划能力

来源: tech.meituan.com 24
许多多模态评测像一场开卷考试:模型看到一张图片,回答一个问题,几秒内结束。但真实世界并不会把所有条件整齐地摆在上下文里。智能体需要持续观察环境、记住早先发现的信息、识别隐藏的前置条件,并在行动失败后调整计划。美团 LongCat 团队构建的 MineExplorer,正是为了把评测从这种相对静态的“温室”搬到动态开放世界中。 MineExplorer ...

当搜索评测不再拉开差距:LoHoSearch 如何用知识图谱重新校准智能体能力

来源: tech.meituan.com 24
过去一年,Search Agent 在 BrowseComp 等评测上的准确率从约 30% 快速提升到 90% 以上。这个数字说明模型进步很快,也暴露出一个评测难题:当大多数强模型都能取得高分,基准便难以继续区分它们的搜索、推理和证据组织能力。 美团开源 LoHoSearch,试图用知识图谱校准我们对搜索智能体能力的判断。它值得关注的不只是更难的题目,...

从 32 篇 AI 顶会论文到可复现实验:美团 ACL、SIGIR、ICML、KDD 论文精讲阅读指南

来源: tech.meituan.com 38
2026 年,美团技术团队有数十篇论文被 ACL、SIGIR、ICML、KDD 等顶级会议收录,并从中精选 32 篇,通过 5 大专场进行直播讲解,其中还包括 ACL'26 杰出论文。对开发者而言,这批内容的价值不只是了解“又出现了哪些新模型”,更在于观察研究团队如何定义问题、设计实验,并把算法放进真实业务约束中验证。 不过,32 篇论文不适合按目录从...

LongCat-2.0 开源:面向 Agentic Coding 的 1.6T 稀疏模型与国产卡推理实践

来源: tech.meituan.com 29
美团正式开源 LongCat-2.0,并同步开放国产卡推理代码。这个模型拥有 1.6T 总参数,但平均每个 Token 仅激活约 48B 参数,目标不是停留在代码补全,而是处理需要理解仓库、修改文件、调用工具并根据执行结果继续修正的真实 Agentic Coding 任务。 LongCat-2.0 的关键数字是“总参数 1.6T、平均激活约 48B”。...

从顶会论文到履约 Agent:美团履约团队的技术路线怎么落地

来源: tech.meituan.com 26
美团履约业务天然复杂:订单、骑手、商家、用户、天气、交通、异常事件交织在一起,很多决策既要实时,又要可解释、可控。来源摘要提到,美团业务研发平台/履约 AI 算法团队正在围绕大模型构建 Agent 技术体系,并探索 Agent 自进化运营系统;技术方向覆盖 CPT、Post-training、Agentic RL、多模态理解,并持续在 ACL、EMNL...

从论文到工程:美团 ASX 团队的 Agent 技术栈给搜推系统带来什么

来源: tech.meituan.com 29
搜索推荐正在从“排序模型 + 规则系统”走向“能理解、能规划、能反馈学习的 Agentic System”。美团业务研发平台/搜推 ASX 团队围绕大模型后训练、Agentic 强化学习、多模态理解等方向持续产出顶会研究,这类工作对业务工程的启发不只是“模型更大”,而是如何把大模型变成可控、可评估、能嵌入生产链路的智能组件。 在搜索推荐场景里,Agen...

WBench:给交互式视频世界模型做多轮体检

来源: tech.meituan.com 38
世界模型正在从“看视频、续视频”走向“理解动作、响应动作、保持世界一致”。美团 LongCat 团队提出并开源的 WBench,把评测目标对准了这个更难的问题:交互式视频世界模型在多轮交互里到底哪里掉链子。它不像只看单段生成质量的打分表,更像一台“CT 扫描仪”,把模型从被动观看到主动交互的能力拆开检查。 普通视频生成评测通常关心一段视频是否清晰、是否...

海报生成 AIGC:从生成、编辑到评判的工程闭环

来源: tech.meituan.com 40
海报生成看起来像是“输入一句话,出一张图”,但真正落到外卖营销、品牌 IP、活动运营场景里,难点远不止模型会画图。美团智能创作团队围绕海报生成 AIGC 构建了“生成-编辑-评判”的完整技术闭环,并已在美团外卖、品牌 IP 等场景落地和开源。这个方向的价值不只是省几张设计图,而是把创意生产变成可迭代、可审核、可规模化交付的系统。 营销海报通常同时包含商...

用 VitaBench 2.0 重新审视长期动态智能体评测

来源: tech.meituan.com 29
LongCat 开源 VitaBench 2.0,把智能体评测的重心从“单轮答得好不好”推向“长期相处中是否真正理解用户”。它面向真实生活场景,关注长期、动态用户建模,系统评测大语言模型在持续互动里的个性化与主动性能力。 很多智能体 demo 看起来很聪明,因为它们只需要处理一次明确请求:写邮件、查日程、总结文档、生成计划。但真实用户不是静态 prom...