AI 编程工具已经不只是“看几行代码给补全”了。Copilot 在 IDE 里联想,Codex 类工具能重构项目,企业内部 agent 还会轮询仓库、索引依赖、生成补丁。问题是:很多商业源码许可证诞生时,并没有认真描述“AI 可以拿这些代码做什么”。 ACL v1.0 的发布,正是冲着这个空白来的。它试图回答一个新问题:在 AI 时代,代码“可见、可用...
Hugging Face 模型页开始展示 Every Eval Ever 的评测结果,这件事对日常选型很实际:开发者不用只靠模型卡里的自述、排行榜截图或社区帖子来判断模型能力,而是可以在模型页面附近看到更多结构化评测信号。它不会替你做最终决策,但能把“先筛一轮候选模型”的成本降下来。 大模型选型最麻烦的地方,不是找不到模型,而是同名、同尺寸、同架构变体...
AI 在生命科学里的热度很高,但真正难的是:模型能不能处理复杂、真实、带噪声的科研数据,而不是只在整理过的问答题上表现漂亮。GeneBench-Pro 的意义就在这里——它把评测重点放到基因组学、生物学和科学研究场景,用更接近真实工作的数据集测试 AI 的能力边界。 很多通用 AI benchmark 擅长衡量语言理解、代码生成、数学推理,但生命科学任...