“中国词元”:把芯片、模型与绿电放进同一张成本表

2026-08-29 40 预计阅读时间: 1 分钟
来源: oschina.net AI 摘要 Original link

Disclaimer: This article is an AI-assisted summary. Read it together with the original source when precision matters. The summary may omit context, version differences, or edge cases and is not official documentation.

预计阅读时间:9 分钟

8 月 28 日晚,天际资本创始人张倩与开源中国 CEO 徐勇在直播中讨论英伟达收购 Hugging Face。直播后半段,徐勇提到一个由开源中国董事长马越提出、并已在区块链上存证的概念:“中国词元”。

它的公式并不复杂:

中国词元 = 中国芯片 + 中国模型 + 中国绿电

这不是一个新的模型架构,也不是单纯的国产化口号,而是一笔把算力、软件和能源放在一起核算的成本账。一个词元从数据进入模型,到经过推理接口返回给用户,背后至少要消耗三类资源:芯片提供计算能力,模型决定计算效率,电力承担持续运行的能源成本。

从“模型能力”转向“词元成本”

过去讨论大模型时,注意力通常集中在参数规模、训练数据、上下文长度和评测分数上。但模型真正进入生产环境后,企业更关心的是另一组问题:每百万词元需要多少算力?高峰期能否稳定响应?单位请求的电费和硬件折旧是多少?

“中国词元”提供了一个适合成本分析的表达方式。

  • 中国芯片决定推理集群的硬件基础,包括算力密度、显存容量、通信带宽和设备折旧。
  • 中国模型影响单位任务所需的词元数量、推理步数、批处理效率和服务质量。
  • 中国绿电对应数据中心的长期能源账,包括电价、供电稳定性、碳排放和可持续运营能力。

三者并不是简单相加。芯片性能不足,模型可能需要更多并发机器;模型效率不高,电力成本会被放大;电力供应不稳定,再好的芯片和模型也难以形成可靠服务。因此,这个公式更适合被理解为一个系统约束,而不是精确的财务等式。

为什么要把绿电放进公式

人工智能基础设施的成本并不只发生在服务器采购时。训练和推理都需要持续供电,数据中心还要承担制冷、网络、存储和备用电源等配套消耗。随着模型调用量增长,能源会从“基础设施问题”变成产品毛利问题。

把绿电纳入“中国词元”,有两个现实含义。

第一,模型服务需要关注单位词元的完整成本,而不是只看 GPU 或 AI 加速卡的报价。第二,能源来源会影响服务的长期稳定性和合规边界。对于需要大规模部署的模型,电价、绿电比例、机房位置和供电可靠性,最终都会反映到每次 API 调用的成本上。

这也解释了为什么“国产芯片”和“国产模型”不能被孤立讨论。只有硬件、软件和能源同时具备可获得性,词元才可能成为可持续交付的产品单位。

可以这样做一张词元成本表

下面是一个可运行的 Python 小工具。它不是对真实集群的精确建模,而是一个可以改造的估算模板:把芯片折旧、功耗、电价、模型调用量和绿电比例放入同一张表,观察每百万词元的基础成本。

运行前只需要准备 Python 3,不依赖第三方库。示例中的数值是演示假设,实际项目应替换成设备采购价、运行功耗、利用率和电费合同中的数据。

from dataclasses import dataclass


@dataclass
class TokenCostInput:
    accelerator_price: float       # 单卡价格,元
    accelerator_life_hours: float  # 折旧周期,小时
    accelerator_count: int
    power_kw_per_card: float       # 单卡平均功耗,千瓦
    pue: float                     # 数据中心电能使用效率
    electricity_price: float       # 电价,元/千瓦时
    total_tokens: int               # 统计周期内处理的词元数
    green_power_ratio: float        # 绿电比例,0 到 1


def estimate_cost(data: TokenCostInput) -> dict[str, float]:
    hours = data.accelerator_life_hours
    hardware_cost = (
        data.accelerator_price
        * data.accelerator_count
        / hours
    )

    energy_kwh = (
        data.power_kw_per_card
        * data.accelerator_count
        * data.pue
        * 1.0
    )
    energy_cost = energy_kwh * data.electricity_price
    total_cost = hardware_cost + energy_cost
    cost_per_million_tokens = total_cost / data.total_tokens * 1_000_000

    return {
        "hardware_cost_per_hour": hardware_cost,
        "energy_cost_per_hour": energy_cost,
        "green_energy_cost_per_hour": (
            energy_cost * data.green_power_ratio
        ),
        "cost_per_million_tokens": cost_per_million_tokens,
    }


if __name__ == "__main__":
    sample = TokenCostInput(
        accelerator_price=80_000,
        accelerator_life_hours=30_000,
        accelerator_count=8,
        power_kw_per_card=0.7,
        pue=1.3,
        electricity_price=0.65,
        total_tokens=2_000_000,
        green_power_ratio=0.60,
    )

    for name, value in estimate_cost(sample).items():
        print(f"{name}: {value:.4f} 元")

这个示例有几个重要边界:它只计算硬件折旧和能源,不包含模型训练成本、存储、网络、运维人员、机房租赁、备件、软件适配和资本成本;示例还把单个统计周期简化为一小时。生产环境中,可以进一步加入 GPU 利用率、不同请求长度、KV Cache 命中率、批处理大小、故障冗余和训练摊销。

这笔账对企业意味着什么

对于模型公司,“中国词元”意味着服务报价不能只围绕模型能力展开,还要理解每次调用的资源消耗。一个参数量更小、吞吐更高的模型,即使单次效果略有差异,也可能在大规模业务中拥有更低的单位成本。

对于芯片公司,客户买的不是孤立的算力卡,而是一套能被模型充分利用、能在数据中心稳定运行的计算系统。编译器、算子库、通信方案和模型适配效率,都会影响最终的词元价格。

对于数据中心和能源供应商,AI 负载提供了长期而稳定的电力需求,但也提出了更高的供电、制冷和调度要求。绿电如果无法稳定、透明地计量,就很难真正成为成本模型中的可验证变量。

这个概念还有一个提醒:所谓“国产替代”不应只看零部件的产地,而要看一条完整链路能否持续交付。芯片能否供货,模型能否适配,电力能否稳定,三者缺一都会让单位词元成本失真。

落地时先做三件事

  1. 定义统计口径:明确只核算推理,还是把训练和微调成本也摊入词元;明确输入词元、输出词元是否采用不同权重。
  2. 记录真实资源数据:采集设备功耗、GPU 利用率、PUE、每日电价和实际 token 数,避免用峰值参数替代运行数据。
  3. 做敏感性分析:分别改变芯片利用率、模型吞吐、电价和绿电比例,观察每百万词元成本如何变化。

“中国词元”最有价值的地方,不在于公式本身是否足够精确,而在于它迫使产业链用同一个单位讨论问题:一项 AI 服务到底消耗了多少硬件、多少模型能力和多少能源。只有把这三张账合并起来,算力竞争才会从设备采购,进一步走向可持续的单位经济模型。


相关推荐