标签

Hugging Face

用 Gradio Workflow 重建 AUTOMATIC1111:先拆工作流,再复刻界面

来源: huggingface.co 21
重建 AUTOMATIC1111 这类 Stable Diffusion Web UI,难点并不只是摆出提示词输入框、采样器下拉框和生成按钮。真正需要复刻的是一条可组合、可观察、能够持续扩展的推理工作流:参数进入系统,经过模型加载、采样、后处理,再把图像和元数据送回界面。 从来源标题能确认的核心方向,是使用 Gradio Workflow 重新构建 A...

IBM 发布 Granite Time Series PatchTST-FM-r2:面向商业使用的时间序列基础模型

来源: huggingface.co 25
IBM 发布了 Granite Time Series PatchTST-FM-r2 模型,并强调其许可证对商业使用更加友好。对需要预测销量、能源负载、设备指标或业务流量的团队来说,这类时间序列基础模型的价值不只是“换一个预测器”,而是尝试用预训练模型降低每个业务场景都从零建模的成本。 不过,SOTA(State of the Art)或商业友好许可证...

别把整个话题一刀切:让 AI 只拒绝真正危险的请求

来源: huggingface.co 31
安全系统最常见的失败,不只是“放过了危险内容”,还包括“把正常内容一起挡掉”。当一个请求同时包含合法目标、敏感背景和少量高风险操作时,简单地按主题拒绝,虽然实现方便,却会让医疗、网络安全、金融和心理健康等重要场景变得不可用。 更合理的目标不是判断“这个话题能不能谈”,而是识别请求中哪些部分会实质性提高伤害能力,只拒绝那一小部分,并继续回答其余内容。 传...

NeoMME:面向多模态与多语言检索的统一编码器

来源: huggingface.co 43
NeoMME 的定位可以从名称中直接读出:它是一种强调效率的、多模态原生且支持多语言的编码器。这里最值得关注的并不是“又一个向量模型”,而是三个能力被放进了同一条编码链路:处理不同模态、跨越不同语言,并输出可供检索或匹配使用的表示。 由于现有摘要没有给出模型规模、训练数据、基准测试或正式 API,本文不推断具体架构和性能数字。下面重点讨论这类编码器对工...

用 TRL 和 OpenEnv 训练编程模型画出水彩画

来源: huggingface.co 40
把代码模型放进一个可交互环境里,它就不再只是生成一次性答案,而是可以通过行动、观察结果、获得奖励,再调整下一步策略。以“用代码绘制水彩画”为例,模型需要同时处理程序语法、视觉构图和连续迭代,这正适合用 TRL 负责训练流程、用 OpenEnv 描述环境交互。 需要说明的是,来源标题只明确了训练方向,并没有给出具体环境实现、奖励函数或模型配置。下面的代码...

让编码代理拥有你真正掌控的记忆

来源: huggingface.co 22
编码代理可以读取代码、执行命令、修改文件,甚至持续参与一个跨多天的开发任务。但如果每次会话结束后,代理都忘记项目约定、失败原因和关键决策,它就很难从一次性工具变成稳定的工程伙伴。 “给编码代理一份你拥有的记忆”,核心不是简单地把更多文本塞进上下文,而是把记忆从临时会话中抽离出来,存放在开发者能够查看、修改、备份和删除的位置。这样,代理的行为才不会完全依...

用 100 个 GRPO 步骤,让 3.5 亿参数模型更可靠地产生结构化输出

来源: huggingface.co 25
结构化输出的难点通常不在“能不能生成 JSON”,而在于模型能否持续遵守约束:字段完整、类型正确、枚举值合法,并且在输入稍微变化后仍然稳定。这个实验的核心思路,是围绕一个 3.5 亿参数模型设计专门的结构化输出奖励,再用 100 个 GRPO 步骤快速验证微调是否有效。 这里的 100 步更像一个小规模实验预算,而不是适用于所有任务的固定结论。它的价值...

用 Confluent 流式数据驱动 IBM 时间序列模型,实现实时智能

来源: huggingface.co 30
实时智能的关键,不只是把模型部署到生产环境,而是让模型持续接收到最新数据,并把预测结果及时返回业务系统。将 Confluent 的事件流能力与 IBM 时间序列模型结合,可以构建一条从数据采集、特征整理、预测计算到结果发布的连续链路。 由于来源摘要没有提供具体产品版本、连接器名称或 API 契约,下面的代码以“Confluent Kafka 传输带时间...

BenchMIRT:LLM 基准测试到底测量了什么?

来源: huggingface.co 48
当一个大语言模型在某个 benchmark 上取得更高分时,我们很容易把结果直接解释成“模型更聪明了”。但一个分数可能同时受到训练数据污染、题目熟悉度、提示词格式、答案先验、评测脚本以及工具调用能力的影响。BenchMIRT 这个主题真正值得关注的地方,是把问题从“谁的分数更高”推进到“这个分数究竟测量了什么”。 一个 benchmark 通常把复杂能...

用 @huggingface/kernels 把 200 多个 WebGPU Kernel 带进本地 AI 应用

来源: huggingface.co 23
Hugging Face 推出的 将 200 多个 WebGPU Kernel 面向本地 AI 场景开放。它带来的关键变化,不只是“浏览器可以调用 GPU”,而是开发者有机会复用已经实现的计算内核,减少为矩阵运算、归一化或其他模型算子重复编写 GPU 代码的成本。 由于来源摘要没有给出具体 API、支持的算子清单和兼容版本,下面不会假定某个尚未确认的导...