标签

架构设计

Kubernetes 1.37 将 Metrics API 升级为稳定版:迁移到 metrics.k8s.io/v1

来源: kubernetes.io 36
Kubernetes v1.37 将资源指标 API 正式提升为稳定版本:。这意味着节点与 Pod 的 CPU、内存使用量查询接口获得了稳定 API 的兼容性承诺。对日常使用 、依赖资源指标的自动扩缩容,以及直接调用聚合 API 的平台团队而言,重点不在于理解一套新指标,而在于完成一次明确的 API 版本迁移。 需要特别澄清的是:这次升级没有改变指标的...

企业 AI 如何跨过试点陷阱:从用例筛选、双 COE 到生产 XOps

来源: cloud.google.com 39
企业采购大模型许可证并不等于获得 AI 回报。Pythian 在覆盖 27 个国家、约 500 名员工的内部推广中发现,真正拉开差距的不是每人每天节省几分钟,而是把 AI 嵌入工单处理、供应链预测和商品录入等高价值流程,并建立持续维护这些流程的组织能力。 这套方法最终形成了一条完整链路:Field CTO 战略与治理、平台部署、双 COE 执行,以及负...

用 Cloud Run 实例低成本部署长期运行的个人 AI Agent

来源: cloud.google.com 51
对于 OpenClaw、Hermes 这类面向个人开发者的 AI Agent,传统的无状态 Web 服务模型并不总是合适。它们通常需要长期运行、保存状态,而且大多数时间只服务一个用户。Cloud Run 实例正是为这类单实例、长生命周期工作负载提供了更贴近实际的运行方式。 Cloud Run 服务擅长处理无状态、高吞吐的 HTTP 请求。当一段时间没有...

用 Numba 把 Python 模型推向 C 级性能:金融服务中的算法设计实践

来源: infoq.com 41
在精算、风险计量和金融模拟中,模型往往不是因为业务逻辑复杂而变慢,而是因为同一段数值计算被执行了数百万甚至数十亿次。Python 擅长快速表达算法和组织工程代码,但纯 Python 循环在计算密集型场景下容易成为瓶颈。Chad Schuster 分享的实践聚焦于一个现实问题:如何保留 Python 的开发效率,同时借助 Numba JIT 和 GPU ...

Qwen3.8-Flash:125B 总参数如何做到每个 Token 只激活 6B

来源: oschina.net 50
阿里通义千问团队发布的 Qwen3.8-Flash,最值得关注的并不是单一的参数规模,而是它把“模型容量”和“单次推理成本”拆开了:总参数达到 125B,另有 51B N-gram Embedding,但每个 token 只激活约 6B 参数。与此同时,模型原生支持 262K 上下文,并可通过 YaRN 扩展到 1M;相比 Qwen3.7-Plus,训...

JeecgBoot V3.9.5 升级重点:Online、AI Flow 与安全能力一次看懂

来源: oschina.net 45
JeecgBoot V3.9.3 刚完成 Spring Boot 4 架构升级,V3.9.5 很快跟进发布。这一版的重点不是零散修复,而是围绕低代码开发、AI 应用和企业集成能力做了一次集中增强:Online 表单覆盖更多真实业务场景,代码生成器模板更灵活,AI Flow 在模型、知识库和流程编排方面更完整,同时补上了分享 Token、访问限流、Ope...

把 90 年职场研究变成实时教练:Gallup AI 的 Amazon Bedrock 实践

来源: aws.amazon.com 35
Gallup 将 90 年积累的职场科学转化为 Gallup AI,并通过 Amazon Bedrock 在 Gallup Access 应用中向领导者提供实时、个性化的辅导。这个案例的重要之处不只是“接入了一个大模型”,而是把长期沉淀的专业知识嵌入用户已有的工作入口,同时将服务扩展到数千名用户。 通用模型可以生成流畅建议,但领导力辅导需要知道用户面对...

让 AI Agent 逐步获得信任:用分级自主权控制权限与风险

来源: aws.amazon.com 34
很多团队在给 AI Agent 配权限时只有两个选项:完全访问,或者只能读取数据。前者把一次错误决策变成生产事故,后者又让 Agent 很难真正完成工作。更实用的做法是引入“分级自主权”:Agent 从低风险、低权限状态开始,根据持续的可靠表现逐步获得更多操作权限;当质量下降、风险升高或监控发现异常时,权限会自动收回。 这种模式的关键不在于给 Agen...

用 Google Cloud Fault Injection Testing 把云端故障演练变成可重复实验

来源: cloud.google.com 35
数据库切换、可用区故障和网络路径抖动,往往不是架构图上最难的一部分。真正困难的是证明应用在这些事件发生时会按照预期工作。Google Cloud Fault Injection Testing(FIT)在预览阶段提供了原生的故障注入能力,让开发者和架构师可以用实验模板自动化定义故障、目标资源、持续时间和恢复动作。 在自建数据中心中,团队通常可以直接控制...

Uber 如何用应用感知网络提升可靠性,并为云迁移解除阻塞

来源: cloud.google.com 47
当数据分析、AI 工作负载和分布式应用不断把数据推向云端,网络链路就不再只是“带宽够不够”的问题。对 Uber 这样的全球化平台而言,真正的挑战是:在大规模数据传输制造拥塞时,如何保证订单、实时服务和其他关键业务流量仍然稳定运行。 Uber 与 Google Cloud 合作,成为 Cloud Interconnect 应用感知能力的早期设计伙伴。通过...