标签

工程实践

从"猜对答案"到"证得严密":LongCat-Flash-Prover 如何让 AI 真正学会数学证明

来源: tech.meituan.com 28
让大模型做一道高中代数题,它大概率能算出正确答案。但把同样的问题换成"请证明这个结论对所有自然数成立",事情就完全不同了——答案对了不够,每一步推理都必须经得起形式化逻辑的逐行审查,一个模糊的"显然"就能让整条证明链断裂。LongCat-Flash-Prover 正是为这个更难的问题而开源的模型:它不满足于"猜答案",而是要把 AI 推向严谨的形式化定...

LongCat-AudioDiT:扔掉梅尔谱,直接在波形潜空间做扩散 TTS

来源: tech.meituan.com 47
零样本语音克隆一直有个绕不开的痛点——级联误差。从文本到梅尔谱,梅尔谱到声码器波形,每一步转换都在丢信息、叠噪声。美团 LongCat 团队刚发布的 LongCat-AudioDiT,选择了一条更激进的路:把梅尔谱这类中间表示彻底砍掉,直接在波形潜空间里跑扩散模型生成语音。这意味着整条生成链路少了一整段"翻译"环节,误差累积的根源被从中间掐断。 传统 ...

LARYBench:从人类视频学动作表征,通用视觉模型竟然碾压动作专家

来源: tech.meituan.com 47
具身智能领域有个长期隐痛:机器人需要理解"动作",但高质量的动作数据极度稀缺。于是大家把目光投向 YouTube 上海量的人类操作视频——做饭、组装、打扫,这些视频里藏着丰富的动作语义。问题是,从这些"旁观视角"的视频里学到的表征,到底能不能迁移到机器人的控制上?LARYBench 第一次给出了系统化的答案,而且结论出乎意料:通用视觉模型的动作表征,在...

AI写了90%的代码,谁来守住底线——31万行重构的约束实践

来源: tech.meituan.com 54
当仓库里超过九成代码由 AI 生成,决定系统走向的不再是"谁写得更快",而是"谁能约束 AI 的输出"。没有统一规范,AI 只会成倍放大混乱——命名不一致、架构漂移、重复抽象层层叠加,技术债不是线性增长,而是指数膨胀。 我们用 31 万行代码的重构实践验证了一个思路:把 Agent 评测的方法论搬到 AI Coding 管理上,通过技术债盘点、Rule...

LongCat-Video-Avatar 1.5 开源:数字人视频从"能看"到"能用"的跨越

来源: tech.meituan.com 37
数字人视频生成这两年进展很快,但真正拿去做商业项目的人都知道——demo 里那个口型精准、动作流畅的虚拟主播,一旦放到真实业务场景里,唇形漂移、肢体穿模、长视频崩帧这些问题会集中爆发。LongCat-Video-Avatar 1.5 这次开源,核心信号不是"我们又刷了榜单",而是把从 SOTA 到可用之间的那几道硬坎,逐个填上了。 唇形同步是数字人视频...

美团 LongCat 开源 General 365:推理评测的及格线,大多数模型都没摸到

来源: tech.meituan.com 42
大模型推理能力的评测一直是个棘手问题——现有基准要么题目太老被"刷穿",要么覆盖面窄、难以反映真实推理水平。美团 LongCat 团队刚开源的 General 365 试图填补这个空白:365 道题、覆盖多领域、强调推理链而非知识记忆。实测结果相当扎眼——26 款主流模型里,目前得分最高的 Gemini 3 Pro 也只有 62.8%,大多数模型连 6...