标签

全栈

把推荐体验变成可计算指标:大模型自动化评测平台的工程实践

来源: my.oschina.net 37
推荐系统很擅长计算点击,却不容易回答“这批结果是否新颖”“商品与用户意图是否真的相关”。CTR、CVR 可以从实时日志中直接聚合,新颖性、相关性等体验指标却依赖人工判断,反馈周期容易拉长到周级。得物的实践表明,引入大模型评测能力后,这类反馈可以缩短到小时级,并支撑单周百万级审计任务。 CTR 和 CVR 都有明确事件:用户是否点击、是否购买。只要埋点和...

Codex Security CLI 开源:把智能代码安全扫描接入日常开发流程

来源: oschina.net 50
OpenAI 发布了采用 Apache-2.0 协议的开源版 Codex Security CLI。它面向代码仓库安全检查,不只执行一次扫描,还强调跨多次运行追踪问题、验证修复结果,以及接入 CI/CD 流程。项目目前仍处于早期阶段,因此更适合从非阻断式试运行开始,而不是立即把它设为所有仓库的强制发布门禁。 传统命令行扫描器常常输出一份静态报告:某个文...

Firefox 153.0.1 修复 Windows 更新后启动崩溃:升级与排查指南

来源: oschina.net 43
Firefox 153.0.1 是一次针对稳定性的修复更新。它重点处理了 Windows 用户更新 Firefox 后可能遇到的启动崩溃:部分应用内部文件无法加载,导致浏览器无法正常启动。修复后,Firefox 在这类情况下应该能够恢复启动,不过在后续更新完成前,界面的部分区域仍可能显示异常。 这个问题发生在更新之后,而不是普通的网页浏览过程中。其典型...

3T 参数模型部署账本:1.5TB 权重为什么不等于 1.5TB 显存

来源: oschina.net 50
Kimi K3 完整权重开源后,一个比“模型有多强”更现实的问题迅速浮出水面:3T 参数、MXFP4 原生精度的模型,究竟需要多少硬件才能运行?最直观的计算是每个参数占 4 bit,因此仅权重就需要约 1.5TB。问题在于,推理系统装进去的不只是权重。 对于一个 3 万亿参数的模型,如果每个参数严格按 4 bit 存储,理论权重大小为: 按十进制单位计...

A2API 开源:让 AI 只生成一次任务 UI,后续数据操作直接走 API

来源: oschina.net 57
AI Agent 读写业务数据时,一个长期存在的矛盾是:自然语言足够灵活,但每次请求都交给大模型解释,会引入延迟、成本和不确定性。A2API 给出的思路是把 AI 放在任务的“编译阶段”:借助 A2UI 从对话生成任务 UI 和 API 调用结构,之后用户修改筛选、排序、分页或表单字段时,客户端直接调用 HTTP API,不再重复请求大语言模型。 这不...

Dependabot 默认延迟三天更新:用冷静期降低恶意依赖进入代码库的风险

来源: infoq.com 46
GitHub 调整了 Dependabot Version Updates 的默认节奏:新版本发布后,不再立即创建升级 Pull Request,而是等待三天。这个“冷静期”给包仓库、维护者和安全社区留出观察窗口,让恶意版本更有机会在进入项目之前被识别和下架。 自动依赖更新通常遵循一条很直接的链路:上游发布版本,Dependabot 检测到更新,创建 ...

用评测驱动生成式 AI 开发:从实验原型走向规模化交付

来源: medium.com 50
生成式 AI 应用最危险的阶段,往往不是模型完全不可用,而是演示效果不错、上线后却无法稳定回答真实问题。传统软件可以用确定性断言判断对错,LLM 输出则同时受到提示词、模型版本、采样参数、上下文和外部工具影响。要控制这种不确定性,评测不能等到发布前才补做,而应成为需求、开发、发布和线上监控共同依赖的工程基础。 由于来源摘要未提供具体实验数据,下面不把任...

用异常预警与支出上限,为 Google Cloud AI 成本加上双重护栏

来源: cloud.google.com 48
生成式 AI 改变了云成本的增长方式:一个看似简单的提示词,背后可能触发长上下文推理、Agent 工具调用、容器扩容或大规模查询。请求数相同,并不意味着计算量和账单相同,因此仅观察 QPS、调用次数和月底预算告警,已经不足以控制 AI 工作负载的财务风险。 Google Cloud 在 Billing Console 中增加了两类原生能力:AI 服务早...

uniTerm v1.6:把 Kubernetes、容器与 AI 运维装进不到 10MB 的终端

来源: oschina.net 60
终端工具正在从“连接远程服务器”演变成统一的运维工作台。uniTerm v1.6.0 在已有 SSH、RDP、VNC、SFTP、数据库等能力之上,正式加入 Kubernetes 与容器管理,并继续扩展 AI 技能与命令体系。对于需要在服务器、集群、容器和数据库之间频繁切换的开发者,这次更新的价值不只是多了几个入口,而是减少了工具和上下文的切换。 uni...

Grafana Assistant 扩展至 30 多种数据源:自然语言开始串联可观测性上下文

来源: infoq.com 52
Grafana Labs 已将 Grafana Assistant 的查询能力扩展到 30 多种数据源。变化的重点不只是“支持列表变长”,而是让 AI 助手可以通过自然语言跨数据源查询并关联信息:工程师不必在指标、日志、追踪和事件页面之间反复切换,而可以从一个故障问题出发,逐步收集证据。 传统排障经常沿着固定路径展开:先看监控指标确认异常时间,再检索日...