标签

工程实践

用评测驱动生成式 AI 开发:从实验原型走向规模化交付

来源: medium.com 22
生成式 AI 应用最危险的阶段,往往不是模型完全不可用,而是演示效果不错、上线后却无法稳定回答真实问题。传统软件可以用确定性断言判断对错,LLM 输出则同时受到提示词、模型版本、采样参数、上下文和外部工具影响。要控制这种不确定性,评测不能等到发布前才补做,而应成为需求、开发、发布和线上监控共同依赖的工程基础。 由于来源摘要未提供具体实验数据,下面不把任...

CatPaw 正式上线:从 AI 工作台到企业级 Agent 托管,如何真正落地

来源: tech.meituan.com 19
搭载美团 LongCat 2.0 的 CatPaw 正式上线。它关注的不只是让模型“跑得动”,而是把模型能力放进真实工作流程,进一步做到“用得好”。从已公布的信息看,CatPaw 同时提供开箱即用的 AI 智能工作台,以及面向企业的 Agent 开发与托管能力,覆盖个人提效和组织级智能化两类场景。 这两类能力看似都叫 Agent,落地方式却很不一样:个...

MineExplorer:把多模态大模型放进开放世界,重新检验长程规划能力

来源: tech.meituan.com 23
许多多模态评测像一场开卷考试:模型看到一张图片,回答一个问题,几秒内结束。但真实世界并不会把所有条件整齐地摆在上下文里。智能体需要持续观察环境、记住早先发现的信息、识别隐藏的前置条件,并在行动失败后调整计划。美团 LongCat 团队构建的 MineExplorer,正是为了把评测从这种相对静态的“温室”搬到动态开放世界中。 MineExplorer ...

当搜索评测不再拉开差距:LoHoSearch 如何用知识图谱重新校准智能体能力

来源: tech.meituan.com 23
过去一年,Search Agent 在 BrowseComp 等评测上的准确率从约 30% 快速提升到 90% 以上。这个数字说明模型进步很快,也暴露出一个评测难题:当大多数强模型都能取得高分,基准便难以继续区分它们的搜索、推理和证据组织能力。 美团开源 LoHoSearch,试图用知识图谱校准我们对搜索智能体能力的判断。它值得关注的不只是更难的题目,...

从旅客完整旅程中学习:如何构建更懂用户的 Airbnb 搜索个性化

来源: medium.com 22
住宿搜索的难点不只是找出“质量最高”的房源,而是判断某位旅客在当前阶段最可能需要什么。来源没有提供技术摘要,因此无法确认 Airbnb 实际采用的模型、特征或系统架构。仅从标题可以确定一个重要方向:个性化搜索不应只观察当前查询,还要从旅客跨越发现、比较、收藏、预订与入住的完整旅程中学习。 同一句“东京住宿”,在不同旅程阶段可能表达完全不同的需求: 刚开...

把 LLM 评测从数周压缩到一天:一条可持续迭代的工程路径

来源: medium.com 30
LLM 应用真正拖慢迭代的,往往不是模型调用本身,而是准备数据、批量执行、人工复核和汇总结果之间的等待。来源标题给出了一个鲜明结果:评测周期从数周缩短到一天。由于摘要没有披露具体实现,下面不推测原团队的技术栈,而是给出一套可以这样实践的工程方案:让评测集可版本化,让任务并发执行,让失败能够恢复,并把人工判断集中在最有价值的样本上。 一次完整评测通常由多...

从 32 篇 AI 顶会论文到可复现实验:美团 ACL、SIGIR、ICML、KDD 论文精讲阅读指南

来源: tech.meituan.com 37
2026 年,美团技术团队有数十篇论文被 ACL、SIGIR、ICML、KDD 等顶级会议收录,并从中精选 32 篇,通过 5 大专场进行直播讲解,其中还包括 ACL'26 杰出论文。对开发者而言,这批内容的价值不只是了解“又出现了哪些新模型”,更在于观察研究团队如何定义问题、设计实验,并把算法放进真实业务约束中验证。 不过,32 篇论文不适合按目录从...

LongCat-2.0 开源:面向 Agentic Coding 的 1.6T 稀疏模型与国产卡推理实践

来源: tech.meituan.com 28
美团正式开源 LongCat-2.0,并同步开放国产卡推理代码。这个模型拥有 1.6T 总参数,但平均每个 Token 仅激活约 48B 参数,目标不是停留在代码补全,而是处理需要理解仓库、修改文件、调用工具并根据执行结果继续修正的真实 Agentic Coding 任务。 LongCat-2.0 的关键数字是“总参数 1.6T、平均激活约 48B”。...

从顶会论文到履约 Agent:美团履约团队的技术路线怎么落地

来源: tech.meituan.com 25
美团履约业务天然复杂:订单、骑手、商家、用户、天气、交通、异常事件交织在一起,很多决策既要实时,又要可解释、可控。来源摘要提到,美团业务研发平台/履约 AI 算法团队正在围绕大模型构建 Agent 技术体系,并探索 Agent 自进化运营系统;技术方向覆盖 CPT、Post-training、Agentic RL、多模态理解,并持续在 ACL、EMNL...

从论文到工程:美团 ASX 团队的 Agent 技术栈给搜推系统带来什么

来源: tech.meituan.com 28
搜索推荐正在从“排序模型 + 规则系统”走向“能理解、能规划、能反馈学习的 Agentic System”。美团业务研发平台/搜推 ASX 团队围绕大模型后训练、Agentic 强化学习、多模态理解等方向持续产出顶会研究,这类工作对业务工程的启发不只是“模型更大”,而是如何把大模型变成可控、可评估、能嵌入生产链路的智能组件。 在搜索推荐场景里,Agen...