标签

全栈

3T 参数模型部署账本:1.5TB 权重为什么不等于 1.5TB 显存

来源: oschina.net 18
Kimi K3 完整权重开源后,一个比“模型有多强”更现实的问题迅速浮出水面:3T 参数、MXFP4 原生精度的模型,究竟需要多少硬件才能运行?最直观的计算是每个参数占 4 bit,因此仅权重就需要约 1.5TB。问题在于,推理系统装进去的不只是权重。 对于一个 3 万亿参数的模型,如果每个参数严格按 4 bit 存储,理论权重大小为: 按十进制单位计...

A2API 开源:让 AI 只生成一次任务 UI,后续数据操作直接走 API

来源: oschina.net 19
AI Agent 读写业务数据时,一个长期存在的矛盾是:自然语言足够灵活,但每次请求都交给大模型解释,会引入延迟、成本和不确定性。A2API 给出的思路是把 AI 放在任务的“编译阶段”:借助 A2UI 从对话生成任务 UI 和 API 调用结构,之后用户修改筛选、排序、分页或表单字段时,客户端直接调用 HTTP API,不再重复请求大语言模型。 这不...

Dependabot 默认延迟三天更新:用冷静期降低恶意依赖进入代码库的风险

来源: infoq.com 22
GitHub 调整了 Dependabot Version Updates 的默认节奏:新版本发布后,不再立即创建升级 Pull Request,而是等待三天。这个“冷静期”给包仓库、维护者和安全社区留出观察窗口,让恶意版本更有机会在进入项目之前被识别和下架。 自动依赖更新通常遵循一条很直接的链路:上游发布版本,Dependabot 检测到更新,创建 ...

用评测驱动生成式 AI 开发:从实验原型走向规模化交付

来源: medium.com 25
生成式 AI 应用最危险的阶段,往往不是模型完全不可用,而是演示效果不错、上线后却无法稳定回答真实问题。传统软件可以用确定性断言判断对错,LLM 输出则同时受到提示词、模型版本、采样参数、上下文和外部工具影响。要控制这种不确定性,评测不能等到发布前才补做,而应成为需求、开发、发布和线上监控共同依赖的工程基础。 由于来源摘要未提供具体实验数据,下面不把任...

用异常预警与支出上限,为 Google Cloud AI 成本加上双重护栏

来源: cloud.google.com 21
生成式 AI 改变了云成本的增长方式:一个看似简单的提示词,背后可能触发长上下文推理、Agent 工具调用、容器扩容或大规模查询。请求数相同,并不意味着计算量和账单相同,因此仅观察 QPS、调用次数和月底预算告警,已经不足以控制 AI 工作负载的财务风险。 Google Cloud 在 Billing Console 中增加了两类原生能力:AI 服务早...

uniTerm v1.6:把 Kubernetes、容器与 AI 运维装进不到 10MB 的终端

来源: oschina.net 25
终端工具正在从“连接远程服务器”演变成统一的运维工作台。uniTerm v1.6.0 在已有 SSH、RDP、VNC、SFTP、数据库等能力之上,正式加入 Kubernetes 与容器管理,并继续扩展 AI 技能与命令体系。对于需要在服务器、集群、容器和数据库之间频繁切换的开发者,这次更新的价值不只是多了几个入口,而是减少了工具和上下文的切换。 uni...

Grafana Assistant 扩展至 30 多种数据源:自然语言开始串联可观测性上下文

来源: infoq.com 24
Grafana Labs 已将 Grafana Assistant 的查询能力扩展到 30 多种数据源。变化的重点不只是“支持列表变长”,而是让 AI 助手可以通过自然语言跨数据源查询并关联信息:工程师不必在指标、日志、追踪和事件页面之间反复切换,而可以从一个故障问题出发,逐步收集证据。 传统排障经常沿着固定路径展开:先看监控指标确认异常时间,再检索日...

当写代码不再稀缺:AI 时代工程师真正需要的四种能力

来源: infoq.com 27
AI 正在快速降低代码生成的成本,但软件工程并没有因此变成“描述需求,然后等待答案”。真正困难的部分仍然存在:判断应该解决什么、识别系统中的关键风险、理解生成代码的行为,以及确认最终结果是否改善了客户体验。 Ben Greene 结合创业经历提出了一组适应这种变化的工程思维:从简单方案开始、保持对代码的理解、优先攻击困难问题,并用客户影响衡量工作。在代...

德里高院裁定 OpenAI 训练使用新闻内容不侵权:关键在研究例外与证据链

来源: oschina.net 16
印度德里高等法院于当地时间 7 月 24 日裁定,OpenAI 使用亚洲国际新闻社(ANI)的内容训练人工智能模型,不构成版权侵权。法官 Amit Bansal 认为,这类行为落入印度《版权法》规定的研究类“合理使用”例外;同时,ANI 未能提交充分证据,证明 ChatGPT 的回复复制了其受版权保护的表达。 这项裁定值得技术团队关注,不是因为它给所有...

Logback 1.6.1 发布:重点检查 TimeBasedRollingPolicy 的文件滚动配置

来源: oschina.net 24
Logback 1.6.1 已经发布。Logback 延续了 log4j 1.x 的发展脉络,并通过模块化架构覆盖普通 Java 应用、SLF4J 日志实现以及 HTTP 访问日志等场景。本次更新涉及 在设置 选项时的行为,因此,使用按时间滚动日志的服务值得优先检查配置并完成回归测试。 由于现有摘要没有给出该项变更的完整描述,本文不推断具体修复细节,而...