来源: cloud.google.com
32
餐厅电话一响,漏接可能意味着订单流失;医疗机构接到预约电话时,任何一个字段错误都可能影响后续服务。Voicify 的实践说明,企业级语音助手并不只是把大语言模型接到电话系统上,而是要同时解决交易准确性、流量尖峰、响应延迟以及安全合规问题。 Voicify 成立于 2018 年,最初希望为电话、聊天等渠道构建实用的语音驱动助手。疫情期间,团队将重点转向餐...
来源: cncf.io
33
分布式训练最难排查的故障,往往不是 Pod 崩溃,而是所有组件看起来都正常:Kubeflow 任务处于 Running,Pod 没有重启,也没有 OOMKill,但 GPU 大部分时间没有计算。来源摘要描述的正是这种反直觉现象:训练任务健康运行,GPU 却有约 60% 的时间处于空闲状态。 这类问题不能只看 Kubernetes 控制面。分布式训练依赖...
来源: oschina.net
18
CrateDB 6.4.1 已正式发布。这是一次以修复为重点的维护版本。对正在使用 CrateDB 承载日志、指标、设备遥测和工业时序数据的团队来说,维护版本的价值通常不在新语法,而在于降低生产环境中的不确定性,并为后续升级提供更稳定的基线。 CrateDB 的定位不是传统单机关系数据库的简单扩容版。它把分布式存储、分片和并行查询封装在 SQL 接口后...
来源: oschina.net
28
qData 开源版 v1.6.0 的重点不只是新增两个组件,而是改变了数据任务的部署入口:系统内置 Quartz 调度器与 DataX 数据集成执行引擎,同时保留 DolphinScheduler 和 Spark 的完整运行模式。对于只需要定时同步几张业务表、尚未建设大数据基础设施的团队,这意味着可以先用更少的依赖跑起来;对于已有成熟调度和计算平台的团...
来源: aws.amazon.com
30
数字医疗公司面临一个很现实的扩展难题:会员数量增长后,如何继续提供有上下文、有温度的个性化互动,同时不让照护团队被重复沟通压垮。专注于物质使用障碍支持的 Pelago,使用 AWS 构建了 AI 助手,并在两周内将概念推进到实际照护场景。这个案例值得关注的地方,不只是模型能力,而是团队如何用无服务器架构缩短交付路径,并把风险控制嵌入工作流。 医疗 AI...
来源: aws.amazon.com
27
AI 编程工具已经不只是编辑器里的补全插件。monday.com 将运行在 Amazon Bedrock 上的智能体称为“AI Teammates”,并把它们接入真实的软件交付流程。根据其内部生产数据,每月使用 AI 编程工具的 Builder 已从一年前约一半增长到九成,单个工程师的 PR 吞吐量提升超过 50%。更值得关注的不是工具覆盖率,而是团队...
来源: aws.amazon.com
33
CloudFormation 自定义资源可以补上原生资源类型的能力缺口,但它也会把 Lambda、外部 API、状态管理和失败重试带进部署链路。到了多区域场景,如果所有堆栈依赖同一个区域中的处理函数,一次区域故障就可能同时阻塞多个区域的发布。更稳妥的做法是让每个区域拥有独立的自定义资源提供者,并把幂等性、失败隔离和回滚语义设计进处理逻辑。 普通 Clo...
来源: infoq.com
24
GitHub 重新设计了 GitHub Issues 的客户端导航架构,将内存缓存、IndexedDB、预测预取、Service Worker 和后台同步组合起来,减少用户点击链接后等待数据的时间。GitHub 报告称,“即时导航”的比例由 4% 提升到 22%,多个导航场景的延迟也随之下降。 这次改造值得关注的地方,不只是增加了一层缓存,而是重新安排...
来源: cloud.google.com
29
数据平台上线只是开始。进入“Day 2”之后,补丁、升级、容量规划、依赖冲突和故障响应会持续消耗团队精力。Checkout.com 将自托管 Apache Airflow 迁移到 Google Cloud 的 Managed Service for Apache Airflow(Gen 3,Cloud Composer 3)后,把编排器维护转交给托管平...
来源: aws.amazon.com
34
西门子 2024 年报告估算,计划外停机每年给《财富》500 强企业造成约 1.4 万亿美元损失。工业现场真正棘手的地方,不只是设备发生故障,还包括网络不稳定、专家无法及时到场,以及运维人员难以快速定位问题。生成式 AI 可以把手册检索、告警解释和排障建议带到现场,但前提是应用不能把公网和云端模型当作唯一依赖。 离线优先不是简单地在边缘设备上运行一个模...