标签

美团

AI写了90%的代码,谁来守住底线——31万行重构的约束实践

来源: tech.meituan.com 54
当仓库里超过九成代码由 AI 生成,决定系统走向的不再是"谁写得更快",而是"谁能约束 AI 的输出"。没有统一规范,AI 只会成倍放大混乱——命名不一致、架构漂移、重复抽象层层叠加,技术债不是线性增长,而是指数膨胀。 我们用 31 万行代码的重构实践验证了一个思路:把 Agent 评测的方法论搬到 AI Coding 管理上,通过技术债盘点、Rule...

LongCat-Video-Avatar 1.5 开源:数字人视频从"能看"到"能用"的跨越

来源: tech.meituan.com 37
数字人视频生成这两年进展很快,但真正拿去做商业项目的人都知道——demo 里那个口型精准、动作流畅的虚拟主播,一旦放到真实业务场景里,唇形漂移、肢体穿模、长视频崩帧这些问题会集中爆发。LongCat-Video-Avatar 1.5 这次开源,核心信号不是"我们又刷了榜单",而是把从 SOTA 到可用之间的那几道硬坎,逐个填上了。 唇形同步是数字人视频...

美团 LongCat 开源 General 365:推理评测的及格线,大多数模型都没摸到

来源: tech.meituan.com 42
大模型推理能力的评测一直是个棘手问题——现有基准要么题目太老被"刷穿",要么覆盖面窄、难以反映真实推理水平。美团 LongCat 团队刚开源的 General 365 试图填补这个空白:365 道题、覆盖多领域、强调推理链而非知识记忆。实测结果相当扎眼——26 款主流模型里,目前得分最高的 Gemini 3 Pro 也只有 62.8%,大多数模型连 6...