量子基准测试与性能指标:保真度、量子体积与 CLOPS

系统讲解量子基准测试与性能指标:T1/T2 与 SPAM 的测量含义、随机化基准测试 RB 家族与衰减拟合、量子体积与重输出概率判据、CLOPS 与算法量子比特等电路层指标、应用导向基准套件、量子优势判据与交叉熵基准,以及常见基准陷阱与最佳实践。

引言

量子硬件的宣传材料上总是写着一串数字:99.9% 的两比特门保真度、127 个量子比特、量子体积 2^9、CLOPS 数千。这些数字看起来可比,但实际上常常不可比——它们测量的是不同的东西,用了不同的假设,甚至在不同时刻的硬件上测的。

这带来一个实际问题:当你要给一个算法选平台,或者要判断「我的电路能不能跑」,你需要的不是单个数字,而是理解每个指标在测什么、假设是什么、什么时候会骗你。比如 T1 长不代表门保真度高;量子体积高不代表你的电路能跑;两比特门保真度 99.9% 在孤立测量下成立,但同时在 50 个比特上做门时可能降到 99%。

本文系统讲解量子基准测试:先讲为什么难,再拆保真度指标、随机化基准测试家族、量子体积、电路层指标(CLOPS、算法量子比特)、应用导向基准与量子优势判据,最后给出常见陷阱与最佳实践。目标:让你能读懂一份基准报告,并知道哪些数字对你的场景有意义。

前置:量子比特校准与噪声 、量子优势的工程判据 。

为什么量子基准这么难

经典计算机的基准测试(benchmark)相对直接:跑一个固定程序,量时间和吞吐。量子基准难在几件事上。

难在「无法读出全部状态」

经典程序可以打印任意中间变量。量子程序不能:一次测量只能得到一个比特、且测量会破坏状态。要估计一个量子态的任意性质,你得反复制备、测量、统计——这就是层析(tomography),成本随量子比特数指数增长。所以所有量子基准都是间接推断,依赖模型假设。

难在「错误有多种」

不同指标测的是不同错误:

错误类型含义典型测量
相干错误相位/幅度系统性偏离Ramsey、RB 对比
非相干错误随机衰减(T1、T2)T1/T2 测量
门错误门操作引入的错误RB、XEB
SPAM 错误制备与测量错误态层析、RB 截距
串扰相邻比特相互影响并行 RB、串扰谱
泄漏跑出计算子空间泄漏 RB

一个「保真度 99.9%」的数字,可能只包含其中一两类错误。所以在比较平台前,必须先问:这个数字测的是哪类错误、在什么条件下测的?

这一点和经典高性能计算里选基准的思路相通:HPL 测的是稠密线性方程求解的峰值,STREAM 测的是内存带宽,HPC 基准与 HPL 里同样强调「没有单一数字能概括整机」。量子基准的处境更极端,因为连「读出一个中间值」都做不到。

难在「成本与规模」

经典基准可以跑几小时,量子基准不行:每次采样都要重新制备与测量,统计误差随采样数 $1/\sqrt{N}$ 收敛。要区分 99.9% 与 99.95% 的保真度差异,采样量可能相差一个数量级。而大规模电路的单次执行又慢,导致高精度测量与大规模测量不可兼得。

测量目标采样需求现实约束
单门保真度 ±0.01%10^5~10^6 shots可接受(秒级)
多比特串扰矩阵随比特数平方增长需专用协议(循环基准)
全态层析 (n 比特)3^n 次测量n > 10 不可行
XEB 保真度 (50 比特)10^6~10^7 shots小时级

难在「指标之间不可直接换算」

常见误解:T2 = 100 µs,所以能跑深度 100 的电路。这不对——T2 只告诉你退相干时间,不含门错误。一个深度 100 的电路,即使每层门保真度 99.9%,累计保真度也只有 $0.999^{100} \approx 90%$,而且相干错误会随电路结构放大。指标之间没有简单换算公式,必须实测。

保真度基础指标:T1、T2 与 SPAM

相干时间

T1(能量弛豫):|1> 衰减到 |0> 的时间常数
  测量:制备 |1>,延迟 t,测 P(|1>),拟合指数衰减
  典型:超导 100~300 µs,离子阱可达秒级

T2*(自由感应衰减):由低频噪声导致的相位扩散
  测量:Ramsey 干涉,扫延迟时间,拟合振荡包络
  典型:常远小于 T2

T2(Hahn 回波):用 π 脉冲翻转,抵消低频噪声
  测量:Hahn echo 序列
  典型:超导 100~200 µs,通常 T2 <= 2*T1

一个关键细节:$T_2 \le 2T_1$ 是硬约束。如果你看到某平台报 $T_2 = 500$ µs 而 $T_1 = 100$ µs,那一定有问题(除非测量方式特殊)。这个不等式是判断数据可信度的第一个筛子。

SPAM 错误

SPAM(State Preparation And Measurement,态制备与测量)错误是每次实验都会摊到的固定成本:

分量含义典型值
制备错误初始化到 |0> 的残留激发超导 0.1~1%
测量错误把 |0> 判成 |1> 或反之超导 1~3%,离子阱 0.1%
串扰读一个比特影响邻居取决于布线

SPAM 错误在 RB 里表现为衰减曲线的截距($A$ 与 $B$),而不是斜率。所以 RB 能在不知道 SPAM 错误的情况下估出门错误——这是 RB 最巧妙的地方。但反过来,如果你要的是端到端保真度,SPAM 错误必须单独算进去。

RB 衰减模型:
  P_success(m) = A * α^m + B
  其中:
    m     = Clifford 门数量
    α     = 每 Clifford 的衰减因子(与门错误相关)
    A, B  = 吸收 SPAM 错误的常数(截距)
  → 门错误率与斜率有关,与截距无关

随机化基准测试(RB)家族

RB(Randomized Benchmarking)是量子基准的主力工具,核心思路是用随机化把相干错误「洗成」非相干错误,然后用指数衰减提取每门平均错误。

标准 RB 的流程

# 标准 RB 的算法骨架(伪代码)
# 1. 对每个序列长度 m:
#    随机生成 m 个 Clifford 门,末尾加一个逆门使总操作 = 恒等
#    制备 |0...0>,执行序列,测量
#    重复 N 次取成功概率
# 2. 对 m 做指数拟合 P(m) = A * α^m + B
# 3. 由 α 换算每 Clifford 错误率

def error_per_clifford(alpha, d):
    # d = 2^n 为 Hilbert 空间维度
    return (1 - alpha) * (d - 1) / d

RB 家族的变体

变体测什么用途
标准 RB单/两比特门平均错误基础指标
交织 RB (Interleaved RB)特定门在上下文中的错误估某个具体门的错误
同时 RB (Simultaneous RB)并行门的串扰评估真实并行场景
循环基准 (Cycle Benchmarking)每层门的错误(含串扰)大规模系统的可扩展测量
泄漏 RB跑出计算子空间的概率评估泄漏错误
门集层析 (GST)门的具体错误类型诊断性,成本高

循环基准(Cycle Benchmarking) 值得单独说:标准 RB 的序列长度随比特数增长会让状态空间爆炸($d = 2^n$ 的 Clifford 群太大),无法扩展到几十个比特。循环基准改用随机 Pauli 层,每层由随机单比特 Pauli 门加固定两比特门层组成,测量 Pauli 期望值的衰减。它能在 10~100 个比特规模上工作,且直接给出「每层(per cycle)」的错误率——这正是评估大规模系统需要的指标。

循环基准(Cycle Benchmarking)要点:
  - 每个 cycle = 随机单比特 Pauli 层 + 固定的并行两比特门层
  - 在 Pauli 框架下追踪,状态空间不随比特数指数增长
  - 输出:每 cycle 的 Pauli 错误率 EPLG(Error Per Layered Gate)
  - 优势:可测串扰、可扩展到多比特

RB 的假设与失效

RB 有几个强假设,违反了结果就不可信:

  1. 门无关噪声:假设每个门的错误率相同。实际上不同的门错误率差好几倍,RB 给的是「平均」。
  2. 马尔可夫噪声:假设噪声无记忆。如果存在 $1/f$ 噪声或漂移,衰减不是纯指数。
  3. 错误不泄漏:假设错误留在计算子空间内。泄漏会让拟合偏差。
  4. 序列充分随机:随机化必须把相干错误洗成非相干。序列太短或随机性不足,会低估错误。

所以 RB 报出的「99.9%」在孤立测量下成立,但不代表你的电路能跑到 99.9%。并行场景下的串扰往往是 RB 漏掉的最大项。

泄漏与串扰怎么测

泄漏(leakage) 是超导平台特有的麻烦:量子比特是谐振子,操作可能把布居打到 $|2\rangle$ 而不是留在 ${|0\rangle, |1\rangle}$ 子空间。泄漏的害处是它不在 RB 的模型里(RB 假设错误留在子空间内),会让拟合结果偏乐观。

泄漏测量思路:
  1. 标准 RB 序列 + 末尾加一个"泄漏探测"操作
     (把 |2> 映射回计算子空间)
  2. 对比有无探测操作时的衰减曲线
  3. 差异反映泄漏量
  典型:超导单比特泄漏 < 0.1%/门,两比特可达 0.5%/门

串扰(crosstalk) 的测量靠并行 RB:把同一组门同时在多个比特上执行,对比孤立执行时的错误率。差值就是串扰。对超导平台,相邻比特之间的 ZZ 耦合(静态串扰)是主要来源,表现为「邻居在操作时我的频率被推移」。

串扰类型来源测量方法
ZZ 静态耦合固定耦合器、频率碰撞谱测量、并行 Ramsey
驱动串扰微波泄漏到邻近比特并行 RB
读出串扰读出谐振腔耦合同时读出的混淆矩阵
热串扰加热导致邻居退相干温度/弛豫对比

量子体积(Quantum Volume)

量子体积(Quantum Volume, QV)是 IBM 提出的单一数字指标,试图用一个数概括「整机能力」。它的定义很有意思:能成功运行的最大方阵随机电路尺寸。

判据

量子体积的测试协议:
  1. 生成 n 个量子比特的随机方阵电路,深度 = n
     (每层:随机两比特门 + 随机单比特门,拓扑允许的话全连接)
  2. 理想情况下,输出分布的重输出概率(heavy output probability)> 2/3
     "重输出" = 概率高于中位数的那些输出
  3. 实测重输出概率 h
  4. 若 h > 2/3 且统计置信度达 97.5%(约 2 sigma),则 QV >= 2^n
  5. 找满足条件的最大 n,QV = 2^n

关键在于「深度 = 宽度」——这强制电路既有一定宽度又有一定深度,不能靠「很多量子比特但只能跑浅电路」蒙混过关。QV 同时考验了量子比特数、门保真度、连通性、编译质量、读出质量。

QV 的价值与局限

价值:它是一个端到端指标,包含了编译与串扰。两个平台的 QV 可以直接比。

局限:

局限说明
依赖编译器质量同一个硬件换编译器,QV 可能变
只测方阵电路不代表你的电路结构
指数增长的门槛QV 翻倍需要保真度显著提升
全连接假设对稀疏拓扑平台不公平(编译开销计入)
不测特定结构化学模拟、优化问题的表现可能完全不同

所以 QV 是「下限指标」——QV 高说明基础能力不差,但 QV 高不代表你的算法跑得好。

电路层指标:CLOPS 与算法量子比特

QV 描述「能力」,但用户关心的是「吞吐」。这催生了电路层指标。

CLOPS

CLOPS(Circuit Layer Operations Per Second,每秒电路层操作)衡量单位时间能执行多少个电路层:

CLOPS = (层数 × 每次运行重复次数 × 运行次数) / 总时间

一次运行流程:
  1. 编译电路(可能占大头)
  2. 加载到硬件
  3. 执行 N_shots 次
  4. 读出与后处理

注意:CLOPS 把编译时间也算进去(holistic 版本 CLOPS_h)

一个反直觉的事实:CLOPS 常常被编译和经典控制流主导,而不是量子门速度。如果一次作业要编译 10 秒、执行 0.1 秒,CLOPS 会低得可怜。这解释了为什么量子云服务在「小电路高频调用」场景下体验很差。

指标含义何时用
CLOPS每秒电路层操作评估吞吐
CLOPS_h含编译时间的 holistic 版本真实作业吞吐
门速度单门时间评估相干时间预算
作业延迟提交到拿到结果评估云服务体验

算法量子比特

IonQ 提出的「算法量子比特数(#AQ)」是另一个单一数字:对 n 个量子比特,用随机方阵电路测试,看能否在特定保真度阈值下通过。它与 QV 思路类似,但更强调「可用的算法规模」。

这类指标的共同问题是把多维能力压成一维,必然丢信息。用的时候要知道它丢了什么。

应用导向基准与量子优势判据

既然单一数字不够,社区转向应用导向的基准套件。

基准套件内容特点
SupermarQ面向量子计算的 8 类应用特征强调应用相关性
QED-C应用导向的基准集覆盖化学、优化、机器学习
QASMBench真实量子程序集合小到中规模
QScore汇总多个应用指标加权综合
交叉熵基准 (XEB)随机电路保真度估计量子优势验证

交叉熵基准(XEB)

XEB(Cross-Entropy Benchmarking)是验证「量子优势」的核心工具。它用随机电路,比较实测输出分布与理想模拟分布的交叉熵。核心量是线性交叉熵保真度:

XEB 保真度估计:
  F = (cross_entropy_measured - cross_entropy_uniform)
      / (cross_entropy_ideal - cross_entropy_uniform)

  其中 cross_entropy = Σ p_ideal(s) * p_measured(s)
  uniform 基准 = 1/2^n

  F ≈ 1 → 输出与理想高度一致
  F ≈ 0 → 输出随机(无量子优势)

XEB 的优势是不依赖层析:它只用测量到的比特串频率与经典可计算的理想分布(对浅电路可算)比较,能扩展到 50~70 个比特。Google 2019 年的「量子优势」声明就是用 XEB 论证的:53 个比特、深度 20 的随机电路,实测保真度与经典模拟时间对比。

但 XEB 也有争议:「经典无法快速模拟」不等于「有实用价值」。一个只能跑随机电路的系统,和能跑 Shor 算法的系统,是完全不同的东西。这就是量子优势的「工程判据」问题——理论上的优势声明和实际可用性之间隔着一条鸿沟。

基准测试的陷阱与最佳实践

常见陷阱

陷阱表现后果
挑最好的比特只报全系统里最好的几个比特高估整机能力
孤立测门单比特测,不上并行漏掉串扰
忽略 SPAM只报门保真度端到端保真度被高估
不报分布只报平均值掩盖比特间差异
换编译器刷分为基准专门调编译器与真实场景不符
选择性报告只报好的指标无法横向比较
测点漂移测量时刻与使用时刻差很远校准已变

「挑比特」是最普遍的问题。一个 127 比特的系统,可能只有 20 个比特的保真度达标,但宣传里用的是这 20 个的最好成绩。你用的时候如果电路需要全部 127 个比特,实际体验会差很多。

最佳实践

读基准报告时问:
  [ ] 测的是哪些比特?全部还是子集?
  [ ] 是孤立测还是并行测?有没有串扰数据?
  [ ] SPAM 错误单独报了吗?
  [ ] 有分布信息吗(最好/中位/最差)?
  [ ] 编译设置公开了吗(优化等级、seed)?
  [ ] 测量时间与现在差多久?校准更新了吗?
  [ ] 有没有你关心的应用类基准(化学/优化/ML)?
做基准测试时:
  [ ] 用同时 RB 或循环基准,覆盖并行场景
  [ ] 报分布而非单一数字(至少报中位数与四分位)
  [ ] 固定编译设置,公开 seed 与优化等级
  [ ] 测多个时间点,评估漂移
  [ ] 用应用导向基准补充门级指标
  [ ] 明确标注每个数字测的是哪类错误

从指标到决策:一个实际例子

假设你要跑一个变分量子本征求解(VQE)的原型,需要 12 个量子比特、每层 12 个两比特门、约 30 层(约 360 个两比特门),每轮迭代要测几十个可观测量的期望值。现在有两个平台候选:

平台两比特门保真度门时间读出时间连通性QV
A(超导)99.8%200 ns1 µs近邻2^7
B(离子阱)99.5%60 µs120 µs全连接2^9

粗略估算两边的两比特门开销:

平台 A(近邻拓扑):
  逻辑两比特门 360 个,路由后假设 ×3 → 1080 个物理两比特门
  累计保真度 ≈ 0.998^1080 ≈ 11%      ← 基本不可用

平台 B(全连接):
  逻辑两比特门 360 个,无路由开销 → 360 个物理两比特门
  累计保真度 ≈ 0.995^360 ≈ 16%       ← 也低,但好一些

加上 SPAM(每轮读出 12 比特 × 几十个可观测量):
  A:读出 1 µs × ...,SPAM 错误 1~3%/比特
  B:读出 120 µs × ...,SPAM 错误 0.1%/比特

结论:两边都需要误差缓解,甚至纠错,才能得到有意义的结果。 但决策依据很清楚:

  1. 平台的连通性在这里比门保真度更重要——全连接省下的路由开销(3 倍)远超保真度差距(0.3%)。
  2. 读出时间决定了墙钟时间。B 的读出慢 120 倍,如果每轮要读几十个可观测量,总时间会非常长。
  3. 误差缓解是必需品。可以用零噪声外推或概率误差抵消,把有效保真度提上去。

这个例子说明:选平台要按你的电路特征算账,不能只看单一指标。 如果你的电路连接稀疏(比如只在一维链上通信),平台 A 的路由开销就没那么大,超导的速度优势会凸显。反之,连接稠密的电路强烈偏向全连接平台。

类似的「按工作负载特征选硬件」的思路,在推理加速领域也很常见——AI 推理基准 里同样是先明确负载特征(批量大小、序列长度、精度),再对照硬件的实测吞吐,而不是只看峰值算力。

小结

量子基准测试的核心困难是:无法直接观测、错误类型多样、指标不可换算。

  • T1/T2 描述退相干,但 $T_2 \le 2T_1$ 是硬约束,也是判断数据可信度的第一道筛子。
  • SPAM 错误表现为 RB 衰减的截距而非斜率,所以 RB 能在不知 SPAM 的情况下估门错误。
  • RB 家族(标准、交织、同时、循环)各有用途;循环基准是唯一能扩展到几十比特并捕捉串扰的方案。
  • 量子体积把多维能力压成一维,作为下限指标有价值,但不能替代应用测试。
  • CLOPS 常被编译时间主导,holistic 版本才反映真实作业吞吐。
  • XEB 是量子优势验证的主力工具,但「经典难模拟」不等于「有实用价值」。
  • 最常见的陷阱是挑最好的比特、孤立测门、不报分布;读报告时要逐条追问假设。

实践上,选平台前先明确你的电路特征(宽度、深度、两比特门数、连接需求),然后找与你电路结构最接近的应用基准数据,而不是看单一的门保真度或 QV。如果找不到,就用目标平台跑一个你自己的小规模原型电路,实测端到端保真度——这是最可靠的办法。最后,永远把测量时间记下来:量子硬件每天都在漂,一个三个月前的基准数字,参考价值有限。

继续阅读

探索更多技术文章

浏览归档,发现更多关于系统设计、工具链和工程实践的内容。

全部文章 返回首页

「quantum」更多文章

  1. 开放量子系统与退相干建模:密度矩阵、Kraus 与 Lindblad 方程
  2. 量子编译器与电路转译:从逻辑线路到硬件脉冲
  3. 离子阱量子计算平台:囚禁原理、门操作与规模化