2026-06-04
来源: tech.meituan.com
64
具身智能领域有个长期隐痛:机器人需要理解"动作",但高质量的动作数据极度稀缺。于是大家把目光投向 YouTube 上海量的人类操作视频——做饭、组装、打扫,这些视频里藏着丰富的动作语义。问题是,从这些"旁观视角"的视频里学到的表征,到底能不能迁移到机器人的控制上?LARYBench 第一次给出了系统化的答案,而且结论出乎意料:通用视觉模型的动作表征,在...
2026-06-04
来源: tech.meituan.com
72
当仓库里超过九成代码由 AI 生成,决定系统走向的不再是"谁写得更快",而是"谁能约束 AI 的输出"。没有统一规范,AI 只会成倍放大混乱——命名不一致、架构漂移、重复抽象层层叠加,技术债不是线性增长,而是指数膨胀。 我们用 31 万行代码的重构实践验证了一个思路:把 Agent 评测的方法论搬到 AI Coding 管理上,通过技术债盘点、Rule...
2026-05-25
来源: tech.meituan.com
53
数字人视频生成这两年进展很快,但真正拿去做商业项目的人都知道——demo 里那个口型精准、动作流畅的虚拟主播,一旦放到真实业务场景里,唇形漂移、肢体穿模、长视频崩帧这些问题会集中爆发。LongCat-Video-Avatar 1.5 这次开源,核心信号不是"我们又刷了榜单",而是把从 SOTA 到可用之间的那几道硬坎,逐个填上了。 唇形同步是数字人视频...
2026-05-15
来源: tech.meituan.com
59
大模型推理能力的评测一直是个棘手问题——现有基准要么题目太老被"刷穿",要么覆盖面窄、难以反映真实推理水平。美团 LongCat 团队刚开源的 General 365 试图填补这个空白:365 道题、覆盖多领域、强调推理链而非知识记忆。实测结果相当扎眼——26 款主流模型里,目前得分最高的 Gemini 3 Pro 也只有 62.8%,大多数模型连 6...