标签

LLM

别再刷 Token 了:AI 使用率该从消耗转向产出

来源: oschina.net 28
去年有公司把员工的 Token 消耗量写进绩效考核,结果并没有自动带来生产力,反而催生了荒诞操作:有人让两个 Agent 互相聊天一整天,只为了把用量刷上去。这个现象被称为 tokenmaxxing:用行政指标逼团队“用 AI”,哪怕消耗本身没有任何业务意义。 更有意思的是,复盘者的判断不是“AI 没用”,而是“第一阶段的 tokenmaxxing 已...

PostgreSQL 表太多时,内存和元数据查询会先撑不住

来源: postgr.es 28
“表很多”听起来像是建模风格问题,但在 PostgreSQL 里,它也可能变成实打实的内存和 CPU 问题。一次故障排查中,Linux OOM killer 会偶发杀掉 PostgreSQL,另一些长查询则持续占用 CPU、拖慢应用;最后问题都指向同一个根因:单个数据库里有成千上万张表以及随之膨胀的元数据对象。 排查 PostgreSQL 内存问题时,...

ACL v1.0:当 AI Agent 开始读仓库,商业许可证也要补课了

来源: oschina.net 30
AI 编程工具已经不只是“看几行代码给补全”了。Copilot 在 IDE 里联想,Codex 类工具能重构项目,企业内部 agent 还会轮询仓库、索引依赖、生成补丁。问题是:很多商业源码许可证诞生时,并没有认真描述“AI 可以拿这些代码做什么”。 ACL v1.0 的发布,正是冲着这个空白来的。它试图回答一个新问题:在 AI 时代,代码“可见、可用...

TaiXu-Admin V0.1.1:把 Skill、RAG 和 Agent 的工程边界补齐

来源: oschina.net 41
TaiXu-Admin V0.1.1 的更新重点不在“又接了一个模型”,而在应用系统真正跑起来后会遇到的工程问题:技能怎么加载,知识库怎么重构,历史记忆怎么管,RAG 和 Agent 出错时怎么兜底。这些能力看起来不如模型参数醒目,却直接决定一个 LLM 应用能不能稳定交付。 这次发布实现了 skill 技能加载,并支持在 YAML 中配置全局 ski...

Hugging Face 模型页展示 Every Eval Ever:选模型时少翻几张表

来源: huggingface.co 35
Hugging Face 模型页开始展示 Every Eval Ever 的评测结果,这件事对日常选型很实际:开发者不用只靠模型卡里的自述、排行榜截图或社区帖子来判断模型能力,而是可以在模型页面附近看到更多结构化评测信号。它不会替你做最终决策,但能把“先筛一轮候选模型”的成本降下来。 大模型选型最麻烦的地方,不是找不到模型,而是同名、同尺寸、同架构变体...

走进 Genebench-Pro:如何用更工程化的方式评测基因组 AI 工具

来源: openai.com 27
Genebench-Pro 这个名字透露出两个关键信号:它面向基因相关任务,且强调“Pro”级别的评测。由于来源摘要没有提供更多实现细节,本文不把具体能力包装成既成事实,而是从工程视角讨论:如果你正在引入基因组 AI、LLM 生物信息助手或自动化分析代理,类似 Genebench-Pro 的专业评测体系应该关注什么,以及团队可以怎样搭建一个可复用的最小...

GeneBench-Pro:用真实基因组学任务检验 AI 的科研能力

来源: openai.com 27
AI 在生命科学里的热度很高,但真正难的是:模型能不能处理复杂、真实、带噪声的科研数据,而不是只在整理过的问答题上表现漂亮。GeneBench-Pro 的意义就在这里——它把评测重点放到基因组学、生物学和科学研究场景,用更接近真实工作的数据集测试 AI 的能力边界。 很多通用 AI benchmark 擅长衡量语言理解、代码生成、数学推理,但生命科学任...

用“流行病学”排查 core dump:从罕见崩溃里挖出 18 年老 bug

来源: openai.com 33
一次基础设施崩溃如果只发生在万分之一的请求、千分之一的机器、某个看似随机的时间窗口里,传统调试手段很容易失灵。OpenAI 工程师这次处理的不是单个 core dump,而是一批 core dump:像做流行病学调查一样,把崩溃样本聚类、比对、追踪共同特征,最终同时定位到硬件故障和一个存在了 18 年的软件 bug。 core dump 的价值很直接:...

DiScoFormer:用一个 Transformer 同时学习密度与分数函数

来源: huggingface.co 37
DiScoFormer 这个标题里有两个很重的词:density(概率密度)和 score(分数函数,通常指对数密度的梯度)。如果一个 Transformer 能在不同分布之间同时处理这两类对象,它瞄准的就不是“又一个序列模型”,而是更底层的概率建模接口:既能估计一个点有多可能出现,也能告诉你应该往哪个方向移动才能更接近高概率区域。 由于这里没有更多论...