标签

LLM

乌克兰独立新闻机构如何把 AI 变成韧性,而不是新的风险

来源: openai.com 33
OpenAI、AIRPPU 与 WAN-IFRA 联合发起了一项 AI 计划,目标是帮助乌克兰新闻机构增强创新能力、组织韧性与独立新闻实践。公告传递的重点不是用机器替代记者,而是让身处高压环境的编辑部获得更可持续的技术能力。 对新闻机构来说,引入 AI 的难点从来不只是模型效果。消息来源保护、事实核查、编辑责任、基础设施中断和供应商依赖,都会直接影响最...

Termexo V0.8.1:在手机浏览器里接管本地多 Agent 编程工作台

来源: oschina.net 45
Termexo V0.8.1 把“远程访问”带进了这套 Windows 本地多 Agent 工作台。用户在桌面端设置中开启功能后,同一局域网或 VPN 内的手机、平板和其他电脑,就能通过浏览器打开完整工作台,继续操作 Claude Code、Codex CLI、OpenCode 以及并行终端。 这次更新并不是简单增加一个移动端页面。Termexo 管理...

Google Mantis:用智能体闭环验证漏洞,减少 AI 扫描误报

来源: infoq.com 36
AI 可以快速找出代码中“看起来危险”的模式,但发现疑点并不等于确认漏洞。缺少可达性分析、运行时验证和稳定复现时,扫描结果很容易被误报与模型幻觉淹没。Google 开源的 Mantis 试图把 AI 从单纯的告警生成器变成执行漏洞生命周期的智能体框架,覆盖识别、验证、复现和修复。 传统扫描流程通常停在静态告警:某个输入可能未过滤、某个依赖版本可能受影响...

Google Mantis:用可复现证据压低 AI 漏洞扫描的误报率

来源: infoq.com 35
Google 开源了 Mantis,一个覆盖软件漏洞生命周期的 AI Agent 框架。它处理的不只是“发现可疑代码”,还包括验证漏洞、构造复现方式以及辅助修复。这个方向直指 AI 代码扫描的核心问题:模型能够生成大量看似合理的安全报告,但其中可能混有误报,甚至完全由幻觉产生的漏洞。 传统静态扫描器通常根据数据流、规则或模式输出告警。引入大模型后,扫描...

当 AI 成为“异质心智”:能力跃迁之后,如何把安全护栏做进系统

来源: openai.com 37
AI 的能力正在快速增强,但能力提升并不会自动带来可靠、可控或符合人类意图的行为。Jakub Pachocki 用“异质心智”提醒我们:面对越来越强的模型,不能只观察它在基准测试中答对了多少题,还要考虑它如何理解目标、利用工具,以及在陌生环境中采取什么行动。 这让对齐问题从一项模型研究任务,变成了完整的系统工程问题。更强的模型需要更严格的权限边界、持续...

编码智能体如何加速 AI 研究:从写代码到压缩实验闭环

来源: openai.com 33
OpenAI 内部的早期观察显示,编码智能体正在改变 AI 研究的工作方式:它们不仅补全代码,还能承担实现实验、运行测试、分析失败和准备后续修改等连续任务。真正值得关注的变化,不是单次生成了多少代码,而是研究人员能否用更短时间完成更多可靠的实验闭环。 来源摘要没有披露具体数值,因此本文不推断采用率或加速倍数,而是讨论这些早期信号背后的工程含义,以及团队...

Figma 如何用 AI Agent 将安全告警调查提速 70%

来源: infoq.com 46
安全告警调查很少只是“看一眼日志”。工程师往往要查询多个内部系统、翻阅相似事件、验证资产状态,再决定是否修复代码。Figma 的工程团队将这些重复步骤交给 AI Agent,并让它们利用历史调查经验辅助判断。据其工程实践总结,复杂告警的处理速度因此提升了约 70%。 这里真正值得关注的不是让模型代替安全工程师,而是把调查过程变成一条可调用工具、引用证据...

FreeCORE 接棒 TrueNAS CORE:在 FreeBSD 15 上保留 Jails、虚拟化与 OpenZFS

来源: infoq.com 48
TrueNAS 的发展重心转向基于 Debian 的 SCALE 后,依赖 FreeBSD Jails、OpenZFS 以及既有虚拟化工作流的管理员面临一个现实问题:继续留在逐渐失去更新动力的 CORE,还是迁移到技术栈不同的 SCALE。FreeCORE 提出了第三条路径,将 TrueNAS CORE 推进到 FreeBSD 15.0,并试图保留这些...

从自然语言规则到 DMN 1.5:伏羲智能决策平台如何落地企业决策自动化

来源: oschina.net 49
企业决策系统真正困难的部分,往往不是执行一条规则,而是让业务人员能写、技术人员能审、测试人员能验,并且在发布后还能追溯每次结果。伏羲智能决策平台第一版尝试把这条链路打通:用户用自然语言描述业务规则,LLM 智能体生成结构化 DSL,系统经过多层校验后编译为标准 DMN 1.5 XML,再进入版本管理、业务验收、发布运行和数据分析流程。 让业务人员直接描...

软件工程走向 2030:从写代码转向管理 Token、智能体与产品决策

来源: infoq.com 42
当生成代码的成本持续下降,软件工程的稀缺资源就不再只是开发工时,而会逐渐变成 Token 预算、智能体并发能力、验证流程和产品判断。Meryem Arik 对 2030 年软件工程的预测,指向了一种明显的角色变化:工程师仍然需要理解代码,但工作重心将转向组织多个智能体、控制资源消耗,并对最终产品结果负责。 今天的团队通常管理云计算成本、数据库容量和第三...