标签

LLM

CPython 正式将 RISC-V 列为 Tier 3 平台:开发者现在该如何验证与参与

来源: infoq.com 41
CPython 核心开发团队已经正式认可 RISC-V 为 Tier 3 平台。这不是“所有功能都已经和主流平台完全一致”,而是 RISC-V 支持获得了明确的平台级定位:实现已经经过社区持续协作,接下来需要更多真实硬件、持续测试和性能反馈来推动集成度提升,并为未来迈向 Tier 2 做准备。 对于使用 RISC-V 开发板、服务器或模拟环境的 Pyt...

用 Gradio Workflow 重建 AUTOMATIC1111:先拆工作流,再复刻界面

来源: huggingface.co 24
重建 AUTOMATIC1111 这类 Stable Diffusion Web UI,难点并不只是摆出提示词输入框、采样器下拉框和生成按钮。真正需要复刻的是一条可组合、可观察、能够持续扩展的推理工作流:参数进入系统,经过模型加载、采样、后处理,再把图像和元数据送回界面。 从来源标题能确认的核心方向,是使用 Gradio Workflow 重新构建 A...

用 GPT‑Live‑1 构建可打断、可定制、可接电话的实时语音应用

来源: openai.com 32
GPT‑Live‑1 将自然的全双工语音对话带入 API。相比“录音、上传、等待、播放”这类轮流工作的语音链路,全双工意味着用户说话、模型理解和语音输出可以并行发生。再结合更强的指令遵循、自定义声音与电话系统支持,语音应用可以从带语音按钮的聊天框,进一步变成能够实时响应、允许插话并保持角色一致的交互界面。 传统语音助手通常按顺序执行:语音活动检测、语音...

用 Agents API 构建可长期运行、会调用工具的云端智能体

来源: openai.com 21
云端智能体正在从“一次请求、一次回答”转向更长的执行过程:它需要规划任务、调用工具、保存上下文,并在稍后继续运行。Agents API 面向的正是这类场景:通过托管服务和 Codex harness,统一处理编排、长时间会话与工具使用。 普通聊天接口通常围绕一个同步请求设计:发送提示词,等待文本结果。实际工程任务却可能包含多个步骤,例如读取代码、运行检...

在 Amazon SageMaker HyperPod 上用 vLLM 部署 Qwen3.8-2.4T-A95B

来源: aws.amazon.com 37
Qwen3.8-2.4T-A95B 是一个拥有 2.4 万亿参数的开放权重模型。要把这类模型稳定地运行起来,难点不只是启动一个容器,还包括多节点 GPU 集群规划、模型权重分发、NVFP4 量化、推理并行,以及如何把推理、工具调用和 MTP 投机解码暴露成可用的 API。 Amazon SageMaker HyperPod 负责提供可扩展的训练和推理基...

从百万 Token 到实体机器人:AWS 生成式 AI 的工程边界正在外扩

来源: aws.amazon.com 32
2026 年 8 月,AWS 面向 AI 开发者的一批更新集中落在三个方向:更大的模型上下文、更持久的智能体运行环境,以及从云端向政府区域和物理设备扩展的部署能力。涉及的产品包括 Amazon Bedrock、Amazon Bedrock AgentCore 和 Strands,其中包括 OpenAI 模型的百万 Token 上下文、跨区域推理、最长可...

AlloyDB Omni RPM Orchestrator 正式可用:在裸金属与虚拟机上运行高可用 PostgreSQL

来源: cloud.google.com 39
AlloyDB Omni Red Hat RPM Orchestrator 已正式进入 GA,并与 AlloyDB Omni 18.3.0 同期发布。它瞄准的是一个明确场景:企业希望保留裸金属或虚拟机基础设施,不引入 Kubernetes,同时获得接近托管数据库的高可用、备份恢复、低停机维护和集中编排能力。 这并不意味着所有 PostgreSQL 都应...

Kubernetes v1.37 用统一的节点生命周期条件描述排空、维护与关机

来源: kubernetes.io 39
Kubernetes 能告诉你节点是否就绪、带有哪些污点、运行着哪些 Pod,却一直缺少一种 Kubernetes 原生、跨组件通用的方式来表达“节点正在排空”“维护已经开始”或“正在优雅关机”。Kubernetes v1.37 引入五个标准 Node Condition,为这些运维状态提供统一的发布位置。 新增的生命周期条件都是标准化的 : Cond...

Heurist Finance:用 Amazon Bedrock AgentCore 搭建可审计的 AI 投资工作台

来源: aws.amazon.com 43
Heurist Finance 把投资研究从“聊天问答”推进成了一个可以执行任务的 AI 工作台。用户可以用自然语言提出研究问题,系统按需购买高级市场数据,在隔离沙箱中运行分析,并记录每一次关键动作。 这套方案的重点不只是接入一个大模型,而是把支付、身份、记忆、代码执行和可观测性放进同一个代理运行环境。对于小团队来说,这种组合能减少自建基础设施的范围,...

把专家判断变成组织的“第二大脑”:Meta 的智能代理设计思路

来源: infoq.com 33
很多企业已经有文档搜索、知识库问答和 RAG 系统,但“能找到规则”不等于“能做出判断”。Meta 分享的一种智能代理设计思路,重点不是把更多文件塞进向量数据库,而是捕捉领域专家处理问题时使用的逻辑、约束、证据和升级路径,把这些经验沉淀为组织可以反复调用的“第二大脑”。 这个系统最初面向专业合规场景,但它的架构同样适合安全审查、财务审批、工程变更和采购...