标签

LLM

Hugging Face 模型页展示 Every Eval Ever:选模型时少翻几张表

来源: huggingface.co 35
Hugging Face 模型页开始展示 Every Eval Ever 的评测结果,这件事对日常选型很实际:开发者不用只靠模型卡里的自述、排行榜截图或社区帖子来判断模型能力,而是可以在模型页面附近看到更多结构化评测信号。它不会替你做最终决策,但能把“先筛一轮候选模型”的成本降下来。 大模型选型最麻烦的地方,不是找不到模型,而是同名、同尺寸、同架构变体...

走进 Genebench-Pro:如何用更工程化的方式评测基因组 AI 工具

来源: openai.com 28
Genebench-Pro 这个名字透露出两个关键信号:它面向基因相关任务,且强调“Pro”级别的评测。由于来源摘要没有提供更多实现细节,本文不把具体能力包装成既成事实,而是从工程视角讨论:如果你正在引入基因组 AI、LLM 生物信息助手或自动化分析代理,类似 Genebench-Pro 的专业评测体系应该关注什么,以及团队可以怎样搭建一个可复用的最小...

GeneBench-Pro:用真实基因组学任务检验 AI 的科研能力

来源: openai.com 27
AI 在生命科学里的热度很高,但真正难的是:模型能不能处理复杂、真实、带噪声的科研数据,而不是只在整理过的问答题上表现漂亮。GeneBench-Pro 的意义就在这里——它把评测重点放到基因组学、生物学和科学研究场景,用更接近真实工作的数据集测试 AI 的能力边界。 很多通用 AI benchmark 擅长衡量语言理解、代码生成、数学推理,但生命科学任...

用“流行病学”排查 core dump:从罕见崩溃里挖出 18 年老 bug

来源: openai.com 33
一次基础设施崩溃如果只发生在万分之一的请求、千分之一的机器、某个看似随机的时间窗口里,传统调试手段很容易失灵。OpenAI 工程师这次处理的不是单个 core dump,而是一批 core dump:像做流行病学调查一样,把崩溃样本聚类、比对、追踪共同特征,最终同时定位到硬件故障和一个存在了 18 年的软件 bug。 core dump 的价值很直接:...

DiScoFormer:用一个 Transformer 同时学习密度与分数函数

来源: huggingface.co 37
DiScoFormer 这个标题里有两个很重的词:density(概率密度)和 score(分数函数,通常指对数密度的梯度)。如果一个 Transformer 能在不同分布之间同时处理这两类对象,它瞄准的就不是“又一个序列模型”,而是更底层的概率建模接口:既能估计一个点有多可能出现,也能告诉你应该往哪个方向移动才能更接近高概率区域。 由于这里没有更多论...

用三道防线构建多租户 LLM 分析系统:SigV4、语义校验与行级隔离

来源: aws.amazon.com 37
多租户分析系统接入 LLM 后,最危险的变化不是“模型会不会答错”,而是“模型会不会被诱导越权”。如果一个租户通过自然语言问出了另一个租户的数据,传统的应用层权限判断很容易被 prompt injection、工具调用参数污染或 SQL 生成错误绕过。 PAR 的做法值得关注:他们把安全边界拆成三层,而且每一层都独立工作。请求入口用 AWS SigV4...

用 Amazon Bedrock 和 AWS HealthLake 搭建智能理赔流水线

来源: aws.amazon.com 34
医疗理赔处理最怕两件事:表单信息散落在 PDF、扫描件和附件里,人工录入又慢又容易出错。这个方案的核心变化是把“读单据、抽字段、校验、转成标准医疗数据”串成一条自动化流水线:Amazon Bedrock Data Automation 负责从理赔表单中提取结构化信息,Amazon Bedrock AgentCore 托管 AI Agent 来做校验和转...

用 Amazon Bedrock AgentCore Observability 排查生产 Agent 故障

来源: aws.amazon.com 25
Agent 进入生产环境后,最难处理的不是“模型答错了”这种显性问题,而是它为什么反复调用同一个工具、为什么一次工具调用没有返回、为什么用户看到超时但后端日志看起来正常。Amazon Bedrock AgentCore Observability 的价值就在这里:把 Agent 的执行轨迹、工具调用和运行指标放到同一个可分析的上下文里,让排障从猜测变成...

Claude 登上 Microsoft Foundry:从代理原型到 Azure 生产环境更近一步

来源: azure.microsoft.com 24
Claude in Microsoft Foundry 已正式可用,并由 Azure 托管、运行在 NVIDIA GB300 Blackwell Ultra 上。对正在做 AI Agent 的团队来说,这个变化的重点不只是“多了一个模型入口”,而是把模型试验、企业级部署和云上运行环境放到了更短的路径里。 很多团队已经在本地脚本、Notebook 或独立...