标签

LLM

PostgreSQL 为什么成了 AI 应用的默认数据库

来源: postgr.es 67
越来越多的 AI 产品在技术栈里选了 PostgreSQL——不是因为它重新包装成"AI 数据库",而是因为它本来就是团队最熟悉、最可靠的那层基础设施。Supabase 的普及加速了这一趋势:每次创建 Supabase 项目,底层就是一个 PostgreSQL 实例。主流 AI 框架对 PostgreSQL 和 pgvector 的直接支持,让向量检索...

给 AI 生成内容加上身份证:OpenAI 的内容溯源技术栈

来源: openai.com 69
AI 生成的图片、音频和文本正在以指数级速度涌入互联网。问题不再是"能不能生成",而是"怎么知道这是 AI 生成的"。OpenAI 近期宣布将 Content Credentials(C2PA 标准)、SynthID 水印技术以及一套验证工具整合进自己的产品线,试图从生成端到消费端建立一条完整的内容溯源链路。这对开发者意味着什么——你的应用是否需要对接...

Erupt 1.14.3:让多个 AI Agent 在你的后台管理系统里"组队干活"

来源: oschina.net 53
上周 Erupt 把 Claude 嵌进 Spring Boot 后台的操作刚刷屏,1.14.3 版本就带着更猛的东西来了——A2A 多智能体协作、跨会话记忆、浏览器直连服务器终端。企业级 AI Agent 不再是单兵作战,而是真正在后台里"组团打工"。 A2A(Agent-to-Agent)协议是这次更新的核心。以前在后台管理系统里调 AI,本质上是...

veRL开源Uni-Agent:打通Agent构建、运行与RL训练闭环

来源: oschina.net 43
当前 Agent 开发的一个核心痛点是碎片化:写 Demo 用 LangChain 跑通流程很容易,但要让 Agent 在复杂环境中稳定运行,并把运行产生的交互数据反哺给模型做强化学习(RL)训练,往往需要自建一套沉重的数据清洗、分发与训练管线。字节 veRL 团队刚开源的 Uni-Agent,瞄准的就是这条断层线——它把 Agent 的构建、大规模运...

用 AI Agent 把 Crash 分析从"人工排雷"变成"自动诊断"

来源: my.oschina.net 47
一线开发者对这套流程再熟悉不过:Crash 看板飘红 → 打开堆栈 → 看一眼觉得像内存问题 → 找对应模块负责人 → 对方说"我看看"→ 半天后回复"是第三方 SDK 的锅"→ 再拉 SDK 方排查 → 一轮下来半天没了。如果 Crash 量级大、版本多,专家基本被钉死在排查上,新功能迭代自然减速。 这篇文章讲的是:把这套依赖人的排查流程,交给一个结...

当 AI 需要长期记忆:为什么 PostgreSQL 正在成为企业记忆基础设施

来源: postgr.es 65
当前的 AI 基础设施讨论几乎被模型、GPU、推理速度和向量数据库占据。这些组件确实重要,但它们掩盖了一个更深的架构问题——随着企业从 AI 实验走向运营系统,这个问题正在快速浮现:记忆。 不是简单存储聊天记录或 embedding 的那种记忆,而是跨长时间交互中维持持久上下文、操作连续性、历史理解、工作流状态、推理可追溯性和业务感知的能力。大多数 A...

用 Amazon Bedrock AgentCore 自建代码级评估器:从金融情报 Agent 的四个实战案例说起

来源: aws.amazon.com 66
金融市场的 AI Agent 一旦上线,回答质量直接关系到交易决策和合规风险。Amazon Bedrock AgentCore 最近开放了自定义代码评估器(custom code-based evaluator)能力,让你可以用 Lambda 函数对 Agent 输出做细粒度、可编程的质检——不再只能依赖内置的通用指标。 这篇文章围绕一个金融市场情报 ...

用 LLM Eval 做实验:漏斗而非一刀切

来源: engineering.atspotify.com 67
Spotify 工程团队最近分享了一个关于 LLM Eval 实验设计的核心观点:把 LLM 评估当成漏斗,而不是一刀切的闸门。 这句话看似简单,但背后指向的是很多团队在用 LLM 做自动评估时踩的坑——把 eval 当成 binary pass/fail 的裁判,结果要么放过了坏输出,要么误杀了好输出。 很多团队拿到 LLM eval 的第一反应是:...

Anthropic 发布托管 Agent、主动式工作流与能力阶梯曲线——Code with Claude 2026 要点与实践

来源: infoq.com 52
Anthropic 在旧金山举办的 "Code with Claude 2026" 活动上,一口气抛出三个方向性更新:托管 Agent 让开发者不再自己搭基础设施跑长任务;主动式工作流让 Claude 从"等指令"变成"推进度";能力阶梯曲线则试图把模型升级从模糊的"更强了"变成可预期的工程参数。GitHub、Vercel 和一批 AI-native ...