标签

LLM

用 DBeaver 将 Northwind 示例数据库加载到 PostgreSQL

来源: postgr.es 30
学习 SQL 不一定要从生产数据开始。一个结构清晰、数据规模适中的示例数据库,足以帮助你练习 、过滤、连接、聚合和表结构设计。Northwind 原本来自 Microsoft 数据库生态,但借助现成的 PostgreSQL 脚本,可以很快在本地搭建出一套可查询的练习环境。 本文演示如何使用 DBeaver 打开并执行 ,将表结构和示例数据加载到 Pos...

用 Confluent 流式数据驱动 IBM 时间序列模型,实现实时智能

来源: huggingface.co 33
实时智能的关键,不只是把模型部署到生产环境,而是让模型持续接收到最新数据,并把预测结果及时返回业务系统。将 Confluent 的事件流能力与 IBM 时间序列模型结合,可以构建一条从数据采集、特征整理、预测计算到结果发布的连续链路。 由于来源摘要没有提供具体产品版本、连接器名称或 API 契约,下面的代码以“Confluent Kafka 传输带时间...

多模型、多 Harness 时代:别让 AI Agent 成为失控的“混淆代理”

来源: docker.com 37
AI 系统正在从“调用一个模型”变成“由多个模型、多个 Agent Harness、多个工具共同完成任务”。模型可能来自不同供应商,Harness 可能负责规划、记忆、重试、工具调用或人工审批,而真正产生副作用的动作则发生在数据库、云平台和企业内部系统中。 这种组合带来了一个经典但容易被忽视的问题:混淆代理(confused deputy)。一个程序本...

ATV Big Air Tour 如何用 ChatGPT Work 把三天工作压缩到三小时

来源: openai.com 25
对活动型业务来说,营销文案、商品整理和库存展示往往不是最有创造力的工作,却会持续占用团队时间。ATV Big Air Tour 使用 ChatGPT Work 加速这些环节,把原本需要三天的工作压缩到三小时;更直观的案例是,它把商品照片进一步整理成了一个库存网站,整个过程只用了约 15 分钟。 这件事的价值不只是少写几段文案,而是把分散的资料变成可以继...

从提示词到上下文工程:用 Redis 构建可控的生产级 AI 应用

来源: infoq.com 37
把提示词写得更精巧,并不能自动得到生产级 AI 系统。真实请求往往携带多轮对话、用户偏好、检索结果、工具状态和安全规则;与此同时,系统还要面对 token 上限、上下文失真、API 成本增长与严格的延迟目标。 因此,工程重点需要从“怎样写一句 prompt”转向“怎样在每次调用前组装、压缩、排序和复用上下文”。这就是上下文工程:把模型输入视为一条有预算...

OAuth 可选权限来了:让用户决定 Agent 到底能做什么

来源: infoq.com 28
Cloudflare 为 OAuth 增加了“可选 scope”能力:客户端开发者可以标记哪些权限允许用户在授权页面主动取消。这个变化针对的是一个越来越常见的问题,尤其是在 MCP server 和 AI agent 场景中:Agent 可能需要请求它潜在会使用的全部权限,但用户并不一定愿意一次性授予所有能力。 传统 OAuth 授权通常把 scope...

Cloudflare 为 OAuth Scope 增加“可放弃”标记,MCP 授权可以更细粒度

来源: infoq.com 42
Cloudflare 新增了可选 OAuth scopes:客户端所有者可以明确标记哪些权限允许用户在授权页面取消选择。这个变化主要针对 MCP 服务器和代理场景,因为代理通常需要请求它可能执行的全部操作,最终形成一组权限的并集;用户却未必愿意一次性授予全部能力。 传统 OAuth 授权流程通常围绕一组 scopes 展开。客户端请求 、 和 ,授权服...

组织的第二大脑:如何构建一个向专家学习的 AI

来源: engineering.fb.com 25
当关键知识只存在于少数专家的经验、判断和口头解释中,组织就很难稳定地复用这些能力。一个面向特定领域的 AI agent 可以承担“第二专家”的角色:让更多人随时访问专业知识,也让专家经验得到保存、审计和持续迭代。 这类系统的重点不只是接入一个大模型,而是把专家知识组织成可追溯的结构,并把专家参与学习的过程纳入系统工作流。 普通的领域 agent 往往围...

缓存读取降价 75%:Fable 5.1 真正改变的是 Agent 的长任务成本

来源: oschina.net 51
Fable 5.1 发布中,最容易被基准测试和模型能力指标掩盖的变化,是缓存读取价格从每百万 token 1 美元降到 0.25 美元,直接下降 75%。标准输入和输出价格没有变化,仍分别是每百万 token 10 美元和 50 美元。 这意味着它并不是一次“所有调用都变便宜”的调价,而是精准降低了长上下文 Agent 在重复读取相同上下文时的成本。对...

BenchMIRT:LLM 基准测试到底测量了什么?

来源: huggingface.co 50
当一个大语言模型在某个 benchmark 上取得更高分时,我们很容易把结果直接解释成“模型更聪明了”。但一个分数可能同时受到训练数据污染、题目熟悉度、提示词格式、答案先验、评测脚本以及工具调用能力的影响。BenchMIRT 这个主题真正值得关注的地方,是把问题从“谁的分数更高”推进到“这个分数究竟测量了什么”。 一个 benchmark 通常把复杂能...