来源: engineering.fb.com
25
Meta 连续第十年赞助 Python Software Foundation(PSF)。这件事不只是一次企业公益露出,它更像一个信号:Python 仍然是大型工程组织愿意长期投入的基础设施。对于每天写服务、跑数据、做自动化和搭建 AI 工具的开发者来说,语言生态的健康程度,和语法本身一样重要。 PSF 是支撑 Python 语言和社区的非营利组织。它...
来源: azure.microsoft.com
21
企业把关键业务迁到云上、重构云原生应用、扩展 AI 工作负载时,IaaS 成本很容易从“按需弹性”变成“持续膨胀”。真正长期有效的成本优化,不是月底看账单后手动关几台虚拟机,而是在设计、构建和运营 Azure 基础设施时,把成本效率当成架构原则。 Azure IaaS 的成本主要来自虚拟机、磁盘、网络、备份、日志、快照和跨区域流量。很多团队一开始只盯 ...
来源: postgr.es
24
在 Kubernetes 上跑数据库 Operator,信任链不只落在 GitHub 上的源码。真正启动 Pod 的,是 Operator 拉取的容器镜像;镜像所在的 registry、镜像发布条款、镜像里打包的 PostgreSQL 构建和扩展,都会变成生产系统的一部分。Percona Operator for PostgreSQL 3.0.0 开始...
来源: oschina.net
23
SofaRPC v5.14.3 已发布。这次更新的重点很明确:在生产级 Java RPC 框架里加入 Apache Fory(原 Fury)序列化支持,同时修复 Triple 协议和代理生成相关问题。对正在维护 Java 服务调用链的团队来说,这类版本不只是“升个小版本”,而是关系到序列化开销、协议稳定性和 JDK8 兼容边界的一次补强。 SofaRP...
来源: infoq.com
26
事件驱动架构很容易被描述成“天然可扩展”:生产者写事件,消费者水平扩容,Kafka 扛住吞吐。但在 Java 实时系统里,真正棘手的问题往往不是消息能不能进队列,而是状态放哪里、分区怎么切、重复事件如何处理、JVM 抖动会不会拖垮实时链路。 这篇文章基于一个 Java/Kafka 联络中心平台的经验展开:系统需要支撑约 80k BHCC(busy ho...
来源: oschina.net
38
美团正式发布并开源 LongCat-2.0,把一个总参数量 1.6 万亿、每个 token 约激活 480 亿参数的 MoE 语言模型推到开发者面前。比起单纯刷新参数规模,这次更值得关注的是两个工程信号:模型架构继续向稀疏激活演进,完整训练流程和大规模部署全部跑在国产算力集群上。 LongCat-2.0 是 MoE,也就是 Mixture of Exp...
来源: my.oschina.net
32
性能不是系统上线后的“锦上添花”,而是分布式架构能否承载真实业务的基本能力。电商页面多等一秒,用户可能直接离开;物联网控制链路慢几秒,用户会选择手动按按钮。分布式系统的难点在于:慢不一定慢在代码,也可能慢在网络、数据库、缓存、队列、序列化、线程池,甚至是一次不合理的跨服务调用。 性能优化最常见的误区,是看到响应慢就扩容。扩容当然有用,但如果瓶颈在数据库...
来源: aws.amazon.com
37
多租户分析系统接入 LLM 后,最危险的变化不是“模型会不会答错”,而是“模型会不会被诱导越权”。如果一个租户通过自然语言问出了另一个租户的数据,传统的应用层权限判断很容易被 prompt injection、工具调用参数污染或 SQL 生成错误绕过。 PAR 的做法值得关注:他们把安全边界拆成三层,而且每一层都独立工作。请求入口用 AWS SigV4...
来源: aws.amazon.com
32
当一个 Serverless SaaS 平台从几千个 Lambda 函数增长到超过一百万个函数时,问题会从“函数怎么写”变成“系统怎么活”。来源摘要里提到的几个经验很关键:真正的 scale-to-zero、配额管理、多账户架构,以及尽早和 AWS 服务团队沟通。这些不是架构图上的装饰,而是大规模运行时避免账单失控、部署卡死和突发故障的基本功。 Ser...
来源: aws.amazon.com
38
机器学习环境最容易出现一个矛盾:数据科学家需要快速访问数据、Notebook、模型训练和实验工具;安全团队则要确保敏感数据不会被复制到个人电脑、外部网盘、公共 API 或不受控的网络出口。本文围绕一种三层架构展开:用 Amazon SageMaker AI 承载建模工作区,用 VPC 端点收紧网络路径,再用 Amazon WorkSpaces Secu...