2026-06-09
来源: blogs.oracle.com
30
现代应用和数据库之间,JSON 是最常见的"运输格式"。MySQL 的 JSON 函数支持一直不错——、、 之类的工具随手可用。但问题在于:方向是单向的,且全靠手工拼接。 查数据时,你得用一堆函数把行转成文档;写数据时,又得把 JSON 一层层拆开,逐列逐表写回。这种"JSON 管道工"活儿,写一次嫌烦,维护更痛苦。MySQL 9.7 Communit...
2026-06-09
来源: realpython.com
45
对接 Claude、GPT-4、Gemini、Llama……每家 API 的鉴权方式、请求格式、错误码都不一样。项目里一旦接入超过两个模型,维护成本就直线上升。OpenRouter 把这些差异收拢到一个兼容 OpenAI 格式的统一端点背后,还附带了路由选择、自动降级和用量限额——这些正是多模型场景下最让人头疼的部分。 OpenRouter 的核心思路...
2026-06-09
来源: realpython.com
44
对接一个大模型 API 已经够烦了——不同厂商的端点、认证方式、请求格式各不相同。当你的应用需要同时调用 GPT-4o、Claude、Gemini、Mistral 等多个模型时,维护成本直线上升。OpenRouter 的思路很简单:一个端点、一个 key,路由到上百个模型,还自带故障回退和提供商策略。下面拆解它的核心机制,并给出可直接跑的 Python...
2026-06-09
来源: realpython.com
40
向量数据库正在从"概念热词"变成工程日常。ChromaDB 作为轻量级、Python-first 的向量存储方案,适合本地开发和小规模 RAG(检索增强生成)场景。但真正上手时,很多人会卡在:嵌入怎么选?余弦相似度到底在算什么?collection 查询的参数怎么配?这篇文章把这些问题拆开,配上可以直接跑的代码。 嵌入(embedding)是把一段文本...
2026-06-06
来源: spring.io
62
Spring AI 从 1.0 时代的"试试看"项目,正在蜕变为一个面向生产环境的 AI 应用开发栈。2.0.0-RC1 的发布标志着这条路线的第一个正式里程碑——API 稳定、模块拆分清晰、对主流模型厂商的适配基本到位。如果你之前观望过 Spring AI 但觉得接口还在频繁变动,现在是重新评估的好时机。 2.0 的核心改动不是"加几个新模型",而是...
2026-06-06
来源: docker.com
44
一份行业报告给出了两组值得对读的数字:60% 的组织已经把 AI Agent 推上了生产环境,但 40% 的组织把安全与合规列为继续扩规模的最大障碍。 adoption 跑在前面,oversight 还在后面追——这个落差,就是 AI 治理真正要解决的问题。 AI 不再只是推荐商品或生成文案。它正在审批贷款、调度资源、自动回复客户、甚至直接执行操作。决...
2026-06-05
来源: postgr.es
44
Postgres 社区花了二十年说"绝不",然后加了一个功能,和 hint 做的事一样,只是换了个名字。Postgres 19 的 feature freeze 包含两个新的 contrib 模块: 和 。官方说法是——这叫"plan advice",不是 hint。技术上正确,是最好的正确。 这件事值得好好聊聊,不只是因为功能本身,更因为它背后的漫长...
2026-06-05
来源: realpython.com
44
一个典型的 Python Docker 镜像,起步就是 900MB 甚至更大。大部分体积来自你根本不会用到的东西——系统包、pip 缓存、编译中间产物、测试文件。镜像越大,拉取越慢,部署越贵,安全扫描的噪音越多。这篇文章把常用的瘦身手法逐个拆开,给出可以直接复制改造的 Dockerfile 和命令。 用最朴素的方式打包一个 Flask 项目: 构建完 ...
2026-06-05
来源: infoq.com
65
在端侧跑大模型,推理速度一直是最大的拦路虎。Google 最新发布的 LiteRT-LM 框架引入了对 Gemma 4 Multi-Token Prediction(MTP)drafter 的原生支持,在本地推理场景下最高可达 2.2 倍加速。与此同时,框架的 API 覆盖面也在拓宽——新增了 Swift 和 JavaScript 绑定,不再局限于 K...
2026-06-05
来源: infoq.com
49
端侧跑大模型,瓶颈从来不是模型有多聪明,而是 token 一个一个往外蹦的速度够不够用。Google 最新发布的 LiteRT-LM 把 Gemma 4 的 Multi-Token Prediction(MTP)drafter 原生接进推理引擎,实测推理速度最高提升 2.2 倍——不是靠砍精度,而是靠更聪明的投机解码策略。同时,框架的 API 版图也在...