800G 光模块中 DSP 的深度解析
聚焦:DSP 的作用、工作原理、参考时钟与速率关系
一、DSP 在 800G 光模块中的角色定位
DSP(Digital Signal Processor,数字信号处理器)是 800G 光模块的"大脑",也是模块中功耗最高、技术壁垒最高、成本占比最大的核心元器件。在典型 800G 模块中通常只有 1 颗(少数 OSFP 拆分方案为 2 颗)DSP 芯片,按 8 个 lane 分组集成收发双向的全链路信号处理。
1.1 DSP 的五大核心功能
| 功能 | 发送端(Tx DSP) | 接收端(Rx DSP) |
|---|---|---|
| PAM4 调制/解调 | 比特→PAM4 符号映射(Gray 编码 + DAC 输出) | PAM4 符号判决 + Gray 解码(ADC 采样 + 判决) |
| CDR(时钟数据恢复) | 生成发送端同步时钟 | 从接收的畸变信号中恢复出标准时钟与数据 |
| 均衡(EQ) | 预加重/预失真(FFE),提前抵消传输损耗 | CTLE + DFE 均衡,补偿信道高频衰减 |
| FEC(前向纠错) | RS(544,514) 编码,加入 30 个校验 symbol | FEC 解码,自动检测并纠正传输错误 |
| 色散补偿 | 预补偿(相干模块中) | 色散失真补偿(长距相干模块中) |
一句话理解:激光器负责发光/收光,DSP 负责"修好信号、调度信号、纠错信号"。没有 DSP,800G 的 PAM4 信号就是一锅乱码。
1.2 为什么 800G 必须用 DSP?
根本原因在于 PAM4 调制的"先天贫血":
- PAM4 用 4 个电平编码 2 bit 数据,相比 NRZ 在相同带宽下速率翻倍
- 代价是信噪比下降约 9.5 dB(信号间距仅 NRZ 的 1/3)
- 在 53.125 GBaud 的波特率下,电压张开度极其微弱
- 没有 DSP 的高级均衡算法(CTLE/DFE/FFE)和 FEC 纠错,误码率根本无法达标
1.3 功耗与制程
| 指标 | 400G DSP | 800G DSP | 1.6T DSP |
|---|---|---|---|
| 典型功耗 | ~4W | 5-7W | 8W+ |
| 制程节点 | 7nm | 5nm | 3nm |
| 占模块总功耗 | ~50% | 55%-60% | 更高 |
| BOM 成本占比 | 20%-30% | 35%-45% | 更高 |
| 代表产品 | Marvell 7nm PAM4 DSP | Marvell Spica Gen2 5nm | Broadcom Taurus BCM83640 3nm |
DSP 是模块整机功耗的主要来源(单芯片即集成收发双向全部 8 个 lane)。制程演进是降功耗的核心路径:7nm(400G,约 2022)→ 5nm(800G)→ 3nm(1.6T)。
注:功耗为典型设计估算值(随封装/温度/FEC 配置浮动),非固定规格;400G DSP 主流为 7nm,亦有 5nm 新型号,"代表产品"已按实际制程节点统一标注。
二、为什么 DSP 需要搭配一颗 156.25MHz 的差分晶振(XO)?
2.1 晶振在光模块中的角色
晶振(Crystal Oscillator, XO)是光模块的"心脏"或"时序引擎",为 DSP 和 SerDes 提供最底层的参考时钟(Reference Clock, RefClk)。
在 800G 光模块中,通常使用一颗 156.25MHz 差分晶振(LVPECL 或 LVDS 输出),紧贴 DSP 芯片布局,为其提供:
- 纯净、高精度的时钟基准:频率稳定度 ±25ppm,相位抖动 <50 fs RMS(12kHz~20MHz 积分带宽)
- 差分信号传输:抗共模噪声能力强,适应模块内部复杂电磁环境
- 高基频输出:直接输出 156.25MHz,无需片内倍频即可做 PLL 参考源
2.2 为什么是 156.25MHz?——不是随便选的数字
156.25MHz 与 SerDes 的线速率存在精确的倍数关系,这是整个高速链路时钟设计的基石。
数学推导
800G 光模块的电接口采用 8 条 lane × 106.25 Gbps/lane = 850 Gbps(有效载荷 800 Gbps),每条 lane 使用 PAM4 调制:
| 参数 | 数值 | 说明 |
|---|---|---|
| 单 lane 数据速率 | 106.25 Gbps | PAM4 编码后(每符号 2 bit) |
| 单 lane 波特率(Baud Rate) | 53.125 GBaud | 106.25 ÷ 2 = 53.125 |
| UI(单位间隔) | 18.824 ps | 1 ÷ 53.125 GHz |
| 参考时钟 | 156.25 MHz | XO 输出频率 |
倍数关系验证:
53.125 GHz ÷ 156.25 MHz = 340 倍
106.25 Gbps ÷ 156.25 MHz = 680 倍
156.25 MHz × 340 = 53.125 GHz(波特率)
156.25 MHz × 680 = 106.25 Gbps(数据速率,PAM4 双 bit)
340 是一个整数倍数关系——这意味着 PLL 可以用整数分频模式将 156.25 MHz 倍频到 53.125 GHz,无需小数分频,抖动性能最优。
核心结论:156.25 MHz 不是任意选择的。它被选中是因为 53.125 GHz ÷ 156.25 MHz = 340,是一个干净利落的整数倍。这确保 SerDes 的 PLL 能以整数分频模式工作,输出最纯净的高速时钟。
156.25 MHz 的历史渊源
156.25 MHz 是以太网 SerDes 的"传统频点",源于 10G 以太网时代:
| 以太网速率 | 单 lane 线速率 | 波特率 | 参考时钟 | 倍频系数 |
|---|---|---|---|---|
| 10G Ethernet | 10.3125 Gbps | 10.3125 GBd (NRZ) | 156.25 MHz | ×66 |
| 25G Ethernet | 25.78125 Gbps | 25.78125 GBd (NRZ) | 156.25 MHz | ×165 |
| 50G PAM4 lane | 53.125 Gbps | 26.5625 GBd (PAM4) | 156.25 MHz | ×340(波特 ×170) |
| 100G/lane | 106.25 Gbps | 53.125 GBd (PAM4) | 156.25 MHz | ×680 |
| 200G/lane (未来) | 212.5 Gbps | 106.25 GBd | 312.5 MHz | ×340 |
可以看到,156.25 MHz 贯穿了从 10G 到 100G/lane 的整个以太网演进路线,每次升级只需调整 PLL 倍频系数,时钟架构保持一致。
注:25G 采用 NRZ(波特率=比特率);50G/100G/lane 采用 PAM4,表中 ×340(50G)/×680(100G/lane)为比特速率倍频系数,对应波特率倍频系数为 ×170 / ×340。50G 行标称的 53.125 Gbps 是 PAM4 总信号速率,经 KP4 FEC 开销后净载荷约 50G。
2.3 XO → PLL → SerDes 的时钟链路
完整时钟链路如下:
外部 156.25MHz 差分晶振 (XO)
│
│ 低抖动差分时钟 (<50fs RMS)
▼
┌──────────────┐
│ DSP 内部 │
│ 全局 PLL │ ← 以 156.25MHz 为参考,整数倍频
│ (VCO 倍频) │
└──────┬───────┘
│ 53.125 GHz 高速时钟(波特率时钟)
│ 或 1/4 速率:13.28 GHz(实际 VCO 频率)
▼
┌──────────────┐
│ SerDes │
│ 通道 PLL │ ← 生成正交时钟(I/Q),定义 UI
│ (Tx PLL / │
│ Rx CDR) │
└──────┬───────┘
│
▼
高速串行数据输出/采样
(53.125 GBaud PAM4)
关键设计要点:
- XO 紧贴 DSP 布局:PCB 走线越短越好,减少时钟路径上的反射和噪声耦合
- 差分走线:等长、等距、紧耦合,阻抗控制在 100Ω 差分
- XO 的抖动是整个系统的"抖动底噪":PLL 能滤除 XO 的高频噪声,但低频抖动会原样传递到输出,因此 XO 的 RMS 抖动需 <100 fs(112G PAM4 场景),部分高端应用要求 <50 fs
2.4 为什么不用更高频率的晶振(如 312.5 MHz)?
在 800G 模块中,156.25 MHz 是最主流的参考时钟频点。部分新一代方案确实在向 312.5 MHz 迁移(特别是 224G/lane 的 1.6T 模块):
| 频率 | 适用场景 | 倍频系数(到 53.125 GBaud) | 优势 | 劣势 |
|---|---|---|---|---|
| 156.25 MHz | 400G/800G 主流(100G/lane) | ×340 | 供应链成熟、成本低 | 倍频系数较大,PLL 相位噪声略高 |
| 312.5 MHz | 800G 新(100G/lane)/ 1.6T(200G/lane) | 100G/lane ×170(53.125 GBaud);200G/lane ×340(106.25 GBaud) | 倍频系数减半,PLL 输出抖动更低 | 高基频晶振供应受限、价格更高 |
2.5 ADC/DAC 的采样时钟
ADC 和 DAC 均采用 1x 波特率采样(baud-rate sampling,每个 UI 采/出一个样点),采样时钟本质上就是波特率时钟本身:
| 器件 | 有效采样率 | 采样间隔 | 说明 |
|---|---|---|---|
| ADC(接收) | 53.125 GS/s | 18.82 ps(= 1 UI) | 每符号 1 个样点,6~8 bit SAR |
| DAC(发送) | 53.125 GS/s | 18.82 ps(= 1 UI) | 每符号 1 个样点,输出 PAM4 波形 |
物理实现:时间交织(Time-Interleaved)架构
没有任何单一 ADC/DAC 单元能直接跑 53 GS/s,实际用多路低速切片轮换采样:
| 交织路数 | 每路切片速率 | 相邻切片相位差 | 文献实证 |
|---|---|---|---|
| 64 路 | 830 MS/s(53.125÷64) | 1 UI = 18.82 ps | Hudner VLSI 2018:64-way SAR ADC(56 GS/s÷64=875 MHz/路) |
| 32 路 | 1.66 GS/s | 1 UI = 18.82 ps | Frans JSSC 2017:32-way 交织 |
数字后端时钟:ADC 输出经 demux 并行化(如 64 位宽)后,数字 FFE/DFE 均衡在 ~830 MHz 低速时钟下处理(Rambus 112G PHY 实例:56 GS/s → 64 并行 @ 875 MHz)。
常见困惑:片内是否存在 53 GHz 的时钟信号?
答案:不存在。 53.125 GS/s 是一个"等效采样率",不是任何单一时钟线的频率。时间交织的全部意义就是用多路低速时钟的相位交错来等效出高速采样,片内没有任何时钟信号跑 53 GHz。
实际芯片(以中科院微电子所 56 GS/s ADC 论文为例)的时钟层级为:
| 层级 | 频率 | 说明 |
|------|------|------|
| 片内最高时钟 | 7 GHz | RVCO 输出的 8 相时钟,驱动 T/H 路径 |
| SAR ADC 切片时钟 | 875 MHz | 64 路切片各自的工作频率 |
| 数字后端 | ~830 MHz | demux 并行化后的 FFE/DFE 处理 |
但需区分两类信号:
- 模拟信号本身(PAM4 波形)确实以 53 GBaud 速率变化,模拟前端(CTLE、T/H)必须处理这个带宽
- 时钟信号(数字方波)最高仅 7 GHz,不存在 53 GHz 时钟
类比:8 台相机各拍 7 张/秒,快门时刻错开 1/8 周期 → 合计 56 张/秒等效采样率,但没有任何一台相机跑 56 次/秒。
为什么 1x 波特率采样满足奈奎斯特定理:
常见困惑:奈奎斯特定理要求采样率 ≥ 信号最高频率的 2 倍,为什么采样率 = 波特率(1:1)就够?
关键区分:波特率 ≠ 信号最高频率。波特率恰好是信号最高频率的 2 倍:
| 概念 | 数值 | 关系 |
|---|---|---|
| 波特率 | 53.125 GBaud | = 2 × f_max |
| 信号最高频率 f_max | 26.5625 GHz | = 波特率 ÷ 2 |
| ADC 采样率 f_s | 53.125 GS/s | = 2 × f_max ✅ |
| 奈奎斯特频率(f_s/2) | 26.5625 GHz | = f_max |
采样率 53.125 GS/s 相对信号最高频率 26.5625 GHz 恰好是 2:1,完全满足奈奎斯特定理。 "1x 采样"是 SerDes 术语(每符号一个样点),从信号处理角度看它就是 2 倍过采样。
为什么信号最高频率 = 波特率/2:PAM4 信号经升余弦脉冲整形后,带宽 = (1+α) × 波特率/2(α 为滚降系数,0≤α≤1)。实际系统取 α 接近 0,使信号带宽逼近波特率的一半。这是奈奎斯特无 ISI 准则的结果——脉冲整形在 f = 波特率/2 处对称滚降时,相邻符号在采样时刻的拖尾互相抵消。
| 滚降系数 α | 信号带宽 | 所需采样率(2×带宽) | 与波特率关系 |
|---|---|---|---|
| 0(理想) | 波特率/2 = 26.56 GHz | 53.125 GS/s | = 波特率(1x) |
| 0.5 | 0.75 × 波特率 = 39.84 GHz | 79.69 GS/s | = 1.5 × 波特率 |
| 1(最大) | 波特率 = 53.125 GHz | 106.25 GS/s | = 2 × 波特率 |
其他设计要点:
- CDR 采用 Mueller-Müller 波特率鉴相器,直接从 1x 数据样点提取相位,无需独立边沿采样器
- 2x 过采样(每符号 2 点)可支持分数间隔均衡(FSE),对定时抖动更鲁棒,但 ADC 功耗翻倍,主流商用方案选 1x
- ADC 不是要"重建模拟波形的每个细节",而是"正确判决每个符号的电平"——判决只需每符号一个样点(在眼图中心),恰好满足奈奎斯特
单波 200G 特例:800G-FR4(4×212.5G,106.25 GBaud)的线侧 DAC/ADC 需 106.25 GS/s——已达 224G 级指标,这是单波 200G 光学难做的核心原因之一。
对 800G 而言,156.25 MHz 的抖动性能已经足够满足 112G PAM4 的要求(<100 fs),且供应链成熟、成本可控,因此是最经济的选择。
三、DSP 输入输出速率关系:不是简单的"直通"
3.1 核心结论
DSP 的输入电信号速率与输出电信号速率并不总是一致的,取决于模块的光学架构。 在某些方案中它们一致(1:1 直通),在另一些方案中存在倍数转换关系(通过 DSP 内部的 GearBox 变速箱实现)。
3.2 两种典型场景
场景 A:电光通道一一对应(1:1,速率一致)
典型代表:800G-DR8、800G-SR8
| 参数 | 电接口侧 | 光接口侧 |
|---|---|---|
| 通道数 | 8 lane | 8 lane |
| 单 lane 速率 | 106.25 Gbps PAM4 | 106.25 Gbps PAM4 |
| 总速率 | 850 Gbps | 850 Gbps |
| DSP 角色 | 信号重定时/均衡(Retimer) | 不做速率转换 |
在此场景中,DSP 不做速率转换,仅承担信号均衡、CDR、FEC 等功能。电口 8 条 lane 与光口 8 条 lane 一一对应,DSP 输入输出速率完全一致(106.25 Gbps/lane)。
电口 8×106.25Gbps ──→ [DSP 均衡/CDR/FEC] ──→ 8×106.25Gbps 光口
(8:8 PMA,无变速)
场景 B:电光通道不等(需要 GearBox 变速)
典型代表:800G-FR4(单波 200G)、800G-2×FR4
| 参数 | 电接口侧 | 光接口侧 |
|---|---|---|
| 通道数 | 8 lane | 4 lane |
| 单 lane 速率 | 106.25 Gbps PAM4 | 212.5 Gbps PAM4 |
| 总速率 | 850 Gbps | 850 Gbps |
| DSP 角色 | GearBox 8:4 变速 + 信号处理 | 速率翻倍 |
在此场景中,电口每条 lane 是 106.25 Gbps,但光口只有 4 条 lane,每条 lane 需跑 212.5 Gbps(波特率 106.25 GBaud PAM4)。DSP 内部的 GearBox(变速箱 PMA)负责将 8 条 106.25 G 的电信号合并为 4 条 212.5 G 的信号,输入输出速率存在 2 倍关系。
电口 8×106.25Gbps ──→ [DSP GearBox 8:4 + 均衡] ──→ 4×212.5Gbps 光口
(8:4 PMA,变速比 2:1)
核心原因:目前电接口(800GAUI-8)支持的最大单 lane 速率为 106.25 Gbps PAM4(即"112G SerDes"),但光学侧可以通过更高级的调制或更快的激光器实现单波 200G。两者速率不匹配时,就需要 DSP 内部的 GearBox 做转换。
3.3 速率关系全景表
| 模块类型 | 电口 lane 数 | 电口单 lane 速率 | 光口 lane 数 | 光口单 lane 速率 | DSP GearBox | 输入输出关系 |
|---|---|---|---|---|---|---|
| 800G-SR8 | 8 | 106.25 Gbps | 8 | 106.25 Gbps | 8:8 | 1:1 一致 |
| 800G-DR8 | 8 | 106.25 Gbps | 8 | 106.25 Gbps | 8:8 | 1:1 一致 |
| 800G-2×DR4 | 8 | 106.25 Gbps | 8 | 106.25 Gbps | 8:8 | 1:1 一致 |
| 800G-2×FR4 | 8 | 106.25 Gbps | 4×2端口 | 106.25 Gbps | 8:8 | 1:1 一致 |
| 800G-FR4 | 8 | 106.25 Gbps | 4 | 212.5 Gbps | 8:4 | 2:1 倍速 |
| 800G-FR8 | 8 | 106.25 Gbps | 8 | 106.25 Gbps | 8:8 | 1:1 一致 |
3.4 更深层的理解:PAM4 让"比特率 ≠ 波特率"
理解 DSP 输入输出速率关系的关键,是区分比特率(Gbps)和波特率(GBaud):
| 概念 | 定义 | 800G 示例 |
|---|---|---|
| 比特率(Bit Rate) | 每秒传输的比特数 | 106.25 Gbps(每 lane) |
| 波特率(Baud Rate) | 每秒传输的符号数 | 53.125 GBaud(每 lane) |
| 关系 | 比特率 = 波特率 × log₂(电平数) | 106.25 = 53.125 × 2(PAM4) |
修正说明(重要):DSP 的核心工作不是"NRZ↔PAM4 调制转换"。在 800G 架构中,主机侧电接口(800GAUI-8 / CEI-112G-PAM4)标准规定的信令本身就是 PAM4——DSP 输入输出同为 PAM4,中间不存在 NRZ 串行波形。"NRZ→PAM4 转换"是早期架构的描述(如 50G 时代主机给 25G NRZ、DSP 翻倍成 50G PAM4)。
DSP 内部实际做的是模拟 PAM4 ↔ 数字比特域的转换:
发射方向:PAM4模拟输入 → CTLE → ADC采样 → 数字FFE/DFE均衡(符号域)
→ 符号判决 + Gray解码(符号域→比特域)
→ FEC/重定时/GearBox(比特域)
→ Gray编码(比特域→符号域)→ DAC + TX预加重 → PAM4模拟输出
为什么必须下到比特域(与调制格式无关):
| 功能 | 原因 |
|---|---|
| FEC 编解码 | RS(544,514) 在码字/比特层面运算,无法对模拟电平纠错 |
| GearBox 变速 | 8:4 变速需在并行数字域重新分配比特 |
| 通道对齐/去偏斜 | 对齐标记检测与 deskew 在比特域 |
| 诊断功能 | PRBS 检查、误码计数在比特域 |
DSP 输入的"电信号速率"和输出的"电信号速率"在比特层面通常是一致的(都是 106.25 Gbps/lane),但在符号层面(波特率)可能不同,取决于光通道的调制方式。GearBox 变速箱的本质是在不同位宽/速率的并行总线和高速串行总线之间做速率适配。
四、DSP 内部信号处理全链路
4.1 发送端 DSP 内部数据流
发送方向(host → line):DSP 接收来自交换机的 PAM4 模拟信号,先解调到比特域完成数字处理,再重新调制为 PAM4 输出。全程无 NRZ 环节。
交换机 ASIC
│
│ 800GAUI-8 电接口:8×106.25 Gbps PAM4 模拟差分信号(经走线已衰减)
▼
┌────────────────────────────────────────────┐
│ 发送端 DSP (Tx) │
│ │
│ ┄┄┄ 符号域 / 模拟域处理 ┄┄┄┄┄┄┄┄┄┄┄┄┄┄ │
│ ┌────────┐ ┌───────┐ ┌───────────┐ │
│ │ CTLE │→│ ADC │→│ 数字FFE/DFE │ │
│ │ 模拟均衡│ │ 6~8bit│ │ 采样域均衡 │ │
│ └────────┘ └───────┘ └─────┬─────┘ │
│ │ │
│ ┌──────▼──────┐ │
│ │ CDR+符号判决 │ │
│ │ Gray 解码 │ │
│ └──────┬──────┘ │
│ ════════ 符号域 → 比特域 ═══════ │
│ │ │
│ ┄┄┄ 比特域 / 数字逻辑域处理 ┄┄┄┄┄┄┄┄┄ │
│ ┌──────▼──────┐ │
│ │ 重定时+FIFO │ │
│ └──────┬──────┘ │
│ ┌──────▼──────┐ │
│ │ FEC 处理 │ │ ← 解码重编码或透传
│ │ RS(544,514) │ │ (host FEC 通常端到端)
│ └──────┬──────┘ │
│ ┌──────▼──────┐ │
│ │ GearBox │ │ ← 8:4 变速
│ │ (可选) │ │ (仅单波200G方案)
│ └──────┬──────┘ │
│ ┌──────▼──────┐ │
│ │ 对齐/诊断 │ │ ← Lane对齐/PRBS
│ └──────┬──────┘ │
│ │ │
│ ════════ 比特域 → 符号域 ═══════ │
│ │ │
│ ┄┄┄ 返回符号域 ┄┄┄┄┄┄┄┄┄┄┄┄┄┄┄┄┄┄┄ │
│ ┌──────▼──────┐ │
│ │ Gray 编码 │ │ ← 2bit → PAM4 电平
│ │ + 符号映射 │ │
│ └──────┬──────┘ │
│ ┌──────▼──────┐ │
│ │ TX FFE+DAC │ │ ← 预加重+数模转换
│ └──────┬──────┘ │
└────────────────────────────────┼───────────┘
│
▼ PAM4 模拟信号
LD 驱动器 → 激光器 → 光纤
4.2 接收端 DSP 内部数据流
接收方向(line → host):与发送端完全对称——接收 TIA 的 PAM4 模拟信号,解调到比特域处理后,再重新调制为 PAM4 电信号发给交换机。
光纤 → 探测器(PD) → TIA
│
│ PAM4 模拟电信号(已衰减/畸变)
▼
┌────────────────────────────────────────────┐
│ 接收端 DSP (Rx) │
│ │
│ ┄┄┄ 符号域 / 模拟域处理 ┄┄┄┄┄┄┄┄┄┄┄┄┄┄ │
│ ┌────────┐ ┌───────┐ ┌───────────┐ │
│ │ CTLE │→│ ADC │→│ 数字FFE/DFE │ │
│ │ 模拟均衡│ │ 6~8bit│ │ 采样域均衡 │ │
│ └────────┘ └───────┘ └─────┬─────┘ │
│ │ │
│ ┌──────▼──────┐ │
│ │ CDR+符号判决 │ │
│ │ Gray 解码 │ │
│ └──────┬──────┘ │
│ ════════ 符号域 → 比特域 ═══════ │
│ │ │
│ ┄┄┄ 比特域 / 数字逻辑域处理 ┄┄┄┄┄┄┄┄┄ │
│ ┌──────▼──────┐ │
│ │ FEC 解码 │ │ ← 纠错,降低误码率
│ └──────┬──────┘ │
│ ┌──────▼──────┐ │
│ │ GearBox │ │ ← 4:8 变速
│ │ (可选) │ │ (仅单波200G方案)
│ └──────┬──────┘ │
│ ┌──────▼──────┐ │
│ │ 对齐/重定时 │ │
│ └──────┬──────┘ │
│ │ │
│ ════════ 比特域 → 符号域 ═══════ │
│ │ │
│ ┄┄┄ 返回符号域(重新串行化输出)┄┄┄┄┄ │
│ ┌──────▼──────┐ │
│ │ Gray 编码 │ │
│ └──────┬──────┘ │
│ ┌──────▼──────┐ │
│ │ TX FFE+DAC │ │
│ │ + 输出驱动 │ │
│ └──────┬──────┘ │
└────────────────────────────────┼───────────┘
│
▼ 8×106.25 Gbps PAM4 模拟信号
800GAUI-8 → 交换机 ASIC
两图的关键设计特征:
- 对称结构:发送端与接收端链路镜像对称,都经历"符号域 → 比特域 → 符号域"的完整往返
- CTLE 必须在 ADC 之前:CTLE 是模拟域均衡器,负责在模数转换前初步"撕开"闭合的眼图,同时减少 ADC 所需的位数(无 CTLE 需多 2 bit 分辨率,功耗面积代价远高于 CTLE)
- 两处域转换点:进入比特域靠"符号判决 + Gray 解码",返回符号域靠"Gray 编码 + 符号映射",全程无 NRZ 串行波形
- FEC 策略标注更正:800G 的 RS(544,514) FEC 通常是 host 到 host 端到端的,模块 DSP 内部可能是"解码重编码"(FEC translation,可纠正传输错误后转发)或"码字透传"(FEC-transparent),并非必然做完整编解码
五、关键要点总结
关于 156.25 MHz 参考时钟
| 问题 | 答案 |
|---|---|
| 为什么需要 XO? | DSP 内部 PLL 需要一个低抖动的参考时钟作为频率基准,XO 是整个 SerDes 时钟链路的"心跳"起点 |
| 为什么是 156.25 MHz? | 因为 53.125 GHz ÷ 156.25 MHz = 340 倍(整数),PLL 可用整数分频模式,抖动最优 |
| 为什么不用其他频率? | 156.25 MHz 是以太网 SerDes 的传统频点,从 10G 到 100G/lane 一脉相承,生态成熟 |
| 抖动要求? | 112G PAM4 要求 <100 fs RMS,高端方案 <50 fs |
| 输出类型? | 差分(LVPECL / LVDS),抗共模噪声 |
| 未来趋势? | 224G/lane(200G/lane)时代将转向 312.5 MHz,对应 106.25 GBaud 仅需 ×340 倍频(100G/lane 则为 ×170),抖动要求收紧至 <35 fs |
关于 DSP 输入输出速率关系
| 问题 | 答案 |
|---|---|
| 输入输出速率一致吗? | 取决于光学架构:通道一一对应时一致(1:1),通道数不等时有倍数关系(如 2:1) |
| 什么情况一致? | 800G-DR8/SR8 等 8 电 lane ↔ 8 光 lane 方案,DSP 仅做 Retimer,输入输出均为 106.25 Gbps/lane |
| 什么情况有倍数关系? | 800G-FR4 等 8 电 lane → 4 光 lane 方案,DSP 内部 GearBox 做 8:4 变速,输出 212.5 Gbps/lane(2 倍速) |
| 根本原因? | 电接口(800GAUI-8)固定为 8×106.25G,但光学侧可按需配置不同 lane 数和速率,两者不匹配时需 GearBox 转换 |
| 比特率 vs 波特率? | PAM4 使比特率 = 2 × 波特率(106.25 Gbps = 53.125 GBaud × 2),DSP 在比特域和符号域之间转换 |
六、200G 单 lane 特例分析:800G-FR4 的 DSP 如何处理信号?
前文多次提到 800G-FR4(4×200G)这一"单波 200G"特例。本节专门剖析其 DSP 在信号处理上与 100G 单 lane(800G-DR8/SR8)的本质区别。
6.1 核心差异总览
200G 单 lane 并非简单地将 100G "跑快一倍",而是在波特率、采样率、FEC、均衡算法、带宽需求、封装工艺六个维度全面升级:
| 对比维度 | 100G/lane(800G-DR8/SR8) | 200G/lane(800G-FR4) | 倍数关系 |
|---|---|---|---|
| 线侧比特率 | 106.25 Gbps | 212.5 Gbps | 2× |
| 线侧波特率 | 53.125 GBaud | 106.25 GBaud | 2× |
| 线侧 ADC/DAC 采样率 | 53.125 GS/s | 106.25 GS/s | 2× |
| 奈奎斯特频率 | 26.56 GHz | 53.13 GHz | 2× |
| 电口侧(host) | 8×106.25G PAM4 | 8×106.25G PAM4 | 1×(不变) |
| GearBox | 无(8:8 直通) | 8:4(主流实现) | — |
| OSNR(同样光纤) | 基准 | 恶化 ~3 dB | — |
| FEC 方案 | RS(544,514) KP4 端到端 | 级联 FEC(KP4 外码 + 内码) | — |
| 均衡算法 | FFE + DFE | FFE + DFE + MLSE/MLSD(可能) | — |
| 光/电器件带宽 | >28 GHz | >56 GHz | 2× |
| DSP 工艺节点 | 5nm | 5nm/3nm | — |
| 参考时钟 | 156.25 MHz | 156.25 MHz(或 312.5 MHz) | — |
一句话概括:200G/lane 的 DSP 在线侧(光口侧)所有指标翻倍,而主机侧电口保持 112G SerDes 不变——这个"上下不对等"正是 GearBox 8:4 存在的根本原因,也是整个 200G 方案技术难度的核心。
6.2 线侧波特率翻倍:从 53.125 GBaud 到 106.25 GBaud
这是最根本的变化。100G/lane 的线侧每符号携带 2 bit(PAM4),波特率 53.125 GBaud;200G/lane 仍然用 PAM4(不升级到 PAM6/PAM8),但波特率翻倍到 106.25 GBaud。
100G/lane: 106.25 Gbps ÷ 2 bit/symbol = 53.125 GBaud → UI = 18.82 ps
200G/lane: 212.5 Gbps ÷ 2 bit/symbol = 106.25 GBaud → UI = 9.41 ps
为什么不改用 PAM6/PAM8 而是加倍波特率?
| 方案 | 调制 | 波特率 | SNR 代价(vs NRZ) | 器件带宽需求 | 难点 |
|---|---|---|---|---|---|
| 100G/lane | PAM4 | 53.125 GBd | ~9.5 dB | >28 GHz | 成熟量产 |
| 200G/lane | PAM4 | 106.25 GBd | ~9.5 dB(不变) | >56 GHz | 带宽极限 |
| 200G/lane(替代) | PAM6 | 70.83 GBd | ~13 dB | >35 GHz | SNR 不达标 |
| 200G/lane(替代) | PAM8 | 53.125 GBd | ~16 dB | >28 GHz | SNR 严重不达标 |
加倍波特率保持了 PAM4 的 SNR 优势(仅 9.5 dB 代价),代价是带宽需求翻倍——这比提升调制阶数带来的 SNR 惩罚更容易工程化。所以业界一致选择了"PAM4 + 波特率翻倍"路线。
6.3 ADC/DAC 采样率翻倍:106.25 GS/s 的时间交织实现
线侧 ADC/DAC 的有效采样率从 53.125 GS/s 翻倍到 106.25 GS/s,这是 200G/lane DSP 最硬核的硬件挑战。
时间交织架构的扩展——依然是"多路低速切片轮换"思路,但路数必须大幅增加:
| 实现 | 交织路数 | 每路切片速率 | 实际芯片参考 |
|---|---|---|---|
| 100G/lane ADC | 64 路 | 830 MS/s | Hudner VLSI 2018(56 GS/s) |
| 100G/lane ADC(替代) | 32 路 | 1.66 GS/s | Frans JSSC 2017 |
| 200G/lane ADC | 112 路 | ~950 MS/s | ISSCC 2025 224G 收发器(5nm) |
ISSCC 2025 发表的 212.5 Gb/s PAM4 收发器采用 112 路交织 TI-ADC:TIA 驱动 16 路 Level-1 采样网络(跟踪带宽 >60 GHz),每路再驱动 7 个 ADC 切片(16×7=112),切片的偏移和增益误差在数字域背景校准。
片内时钟层级(200G/lane):
| 层级 | 100G/lane | 200G/lane | 说明 |
|---|---|---|---|
| 等效采样率 | 53.125 GS/s | 106.25 GS/s | 交织合成,非单一时钟 |
| 片内最高时钟(VCO) | ~7 GHz | ~28 GHz(LC-VCO) | 200G 方案用 LC-VCO 而非 RVCO |
| DAC 交错相数 | 4 相 | 4 相(@28 GHz) | 4 相 × 28 GHz = 112 GS/s |
| SAR ADC 切片 | ~875 MHz | ~950 MHz | 单切片速率变化不大,靠增加路数 |
| 数字后端 | ~830 MHz | ~830 MHz | demux 并行化后速率不变 |
关键变化:200G/lane 的片内最高时钟从 ~7 GHz 跃升到 ~28 GHz(LC-VCO),因为 DAC 采用 4 相交错、每相需 28 GHz 时钟驱动。这是与 100G/lane 最大的硬件架构差异之一。但即便如此,片内仍然不存在 106 GHz 的时钟线——106.25 GS/s 是 112 路切片交织的等效结果。
6.3.1 深度解析:为什么片内最高时钟从 7 GHz 跃升到 28 GHz?
这个 4 倍跃升不是任意的,而是由串行化架构的数学约束和VCO 物理特性的差异共同决定的。理解它需要弄清三个问题。
问题一:为什么 100G/lane 方案只需要 7 GHz?
100G/lane 的线侧波特率是 53.125 GBaud,但片内最高时钟远不需要 53 GHz——关键在于多相串行化。以中科院微电子所 56 GS/s ADC 论文(CAS 2022, 28nm)为实证,其时钟链路如下:
外部参考时钟
│
▼
┌─────────────────────────────┐
│ RVCO(环形压控振荡器) │ ← 振荡频率:7 GHz
│ + 注入锁定 PLL(IL-PLL) │ ← 输出:8 相 50% 占空比 7 GHz 时钟
│ │ (PH0-45-90-135-180-225-270-315)
└──────────┬──────────────────┘
│ 8 相 × 7 GHz
▼
第一级 T/H 采样:4 路 × 7 GS/s = 28 GS/s(等效)
│
▼ 分频(÷8)
875 MHz 中间时钟
│
▼ 移位寄存器生成 64 相
64 路 SAR ADC 切片:64 × 875 MS/s = 56 GS/s(等效)
核心数学:等效采样率 = 相数 × 单相时钟频率。100G/lane 的 ADC 侧用 8 相 × 7 GHz = 56 GS/s,片内最高时钟仅需 7 GHz。
TX(DAC)侧同理——100G/lane 的 DAC 采用 4 相交错,每相时钟 14 GHz 即可合成 56 GS/s。但 100G/lane 芯片通常用 1/2 速率或 1/4 速率架构,VCO 跑 7 GHz 后靠多级 MUX 串行化,片内最高时钟长期停在 7~14 GHz 区间。
问题二:为什么 200G/lane 必须 28 GHz?——串行化级数的物理极限
200G/lane 的线侧波特率翻倍到 106.25 GBaud,DAC 需输出 106.25 GS/s。保持同样的"多相交错"思路:
$$\text{等效采样率} = \text{相数} \times \text{单相时钟频率}$$
这里面临一个工程权衡——是增加相数还是提高单相时钟频率?
| 策略 | 相数 | 单相时钟 | 等效采样率 | 问题 |
|---|---|---|---|---|
| ① 仅增加相数 | 16 相 | 7 GHz | 112 GS/s | MUX 级数从 4:1→16:1,抖动累积+面积爆炸 |
| ② 仅提频 | 4 相 | 28 GHz | 112 GS/s | 28 GHz 时钟分布极难,需 LC-VCO |
| ③ 折中(实际选择) | 4 相 | 28 GHz | 112 GS/s | 串行化级数不变,VCO 提频到 28 GHz |
为什么不能走策略①(保持 7 GHz、增加相数)?因为TX 侧的最后一级 MUX 必须在最高速时钟下做"4:1 或 2:1 串行化"。如果 VCO 只有 7 GHz,要从 7 GHz 串行化到 106 GBaud 需要 16:1 的最后一级 MUX——这意味着 16 个并行数据流在同一时钟周期内被选通,电路复杂度和抖动累积完全不可接受。实际芯片的最后一级 MUX 通常不超过 4:1,这就把最低时钟频率锁死在:
$$f_{clock,min} = \frac{\text{波特率}}{\text{最后一级MUX比率}} = \frac{106.25 \text{ GBaud}}{4} \approx 28 \text{ GHz}$$
100G/lane 同理:53.125 GBaud ÷ 4 = 14 GHz,但 100G/lane 芯片常用 1/2 速率(最后一级 2:1 MUX)或 1/4 速率,实际 VCO 在 7~14 GHz。200G/lane 的 ISSCC 2025 方案选择了 1/4 速率架构(4:1 最后级 MUX),所以 VCO 必须 28 GHz。
6.3.2 什么是"1/2 速率""1/4 速率"?
上面提到的"1/2 速率""1/4 速率"是 SerDes 时钟设计的核心概念,描述的是VCO 时钟频率与波特率的比值关系,直接决定了片内最高时钟频率。
| 架构 | VCO 频率 | 与波特率比 | 最后一级 MUX | 时钟沿利用 | 典型适用 |
|---|---|---|---|---|---|
| 全速率(Full-Rate) | = 波特率 | 1:1 | 2:1 | 仅上升沿 | 几乎不用 |
| 半速率(Half-Rate, 1/2) | = 波特率/2 | 1:2 | 2:1 | 上升沿+下降沿 | 中高速 |
| 四分之一速率(Quarter-Rate, 1/4) | = 波特率/4 | 1:4 | 4:1 | 4 相交织 | 主流 |
| 1/8 速率 | = 波特率/8 | 1:8 | 8:1 | 8 相交织 | 低功耗研究型 |
以 100G/lane(53.125 GBaud)为例,不同速率架构下的 VCO 频率:
| 架构 | 计算 | VCO 频率 | 可行性 |
|---|---|---|---|
| 全速率 | 53.125 ÷ 1 | 53.125 GHz | ❌ CMOS 不可实现,时钟树功耗爆炸 |
| 1/2 速率 | 53.125 ÷ 2 | 26.56 GHz | ⚠️ 28nm 下偏高,先进工艺可行 |
| 1/4 速率 | 53.125 ÷ 4 | 13.28 GHz | ✅ 主流舒适区 |
| 1/8 速率 | 53.125 ÷ 8 | 6.64 GHz | ✅ CAS 论文选择(7 GHz RVCO) |
为什么不全用全速率? 全速率 VCO 要跑 53 GHz(100G/lane)或 106 GHz(200G/lane),这在 CMOS 工艺中完全不现实——时钟分布网络的功耗与时钟频率平方成正比,53 GHz 的时钟树功耗会吞噬整个芯片的功耗预算。所以实际芯片几乎都用"降速率 + 多相交织":VCO 跑较低频率,靠多个相位错开的时钟等效出高速采样。速率降得越多,VCO 频率越低、功耗越小,但需要的相数越多、电路越复杂。
为什么 100G/lane 有"7 GHz"和"14 GHz"两档?
这是不同论文/产品的不同架构选择,取决于工艺节点和设计目标:
选 7 GHz(~1/8 速率,CAS 2022 论文,28nm):
VCO 7 GHz → 8 相时钟 → 每相 7 GHz
│
├─ 第一级 T/H:4 路 × 7 GS/s = 28 GS/s
│
└─ ÷8 分频 → 875 MHz → 64 相 → 64 × 875 MS/s = 56 GS/s
片内最高时钟:7 GHz(RVCO 直接产生)
选 7 GHz 的好处:RVCO 在这个频率下相位噪声可控,功耗低,面积小。代价是相数多(ADC 侧 64 相),校准复杂。
选 ~14 GHz(1/4 速率,另一条路线):
VCO ~14 GHz → 4 相时钟 → 每相 ~14 GHz
│
├─ 最后一级 4:1 MUX:4 × 14 GHz = 56 GBaud 串行输出
│
└─ ÷2 分频 → 7 GHz → 后级 ADC 处理
片内最高时钟:~14 GHz
选 14 GHz 的好处:相数少(TX 侧仅 4 相),MUX 级数简单。代价是 VCO 频率更高,在 28nm 下需要更精细的设计,功耗略高。
所以"7~14 GHz"覆盖的是从 1/4 速率(~13 GHz)到 1/8 速率(~7 GHz)的实际工程范围。 设计师在这个区间内有自由度,可根据工艺节点和功耗目标选择。
对比 200G/lane:为什么它"没得选"
| 参数 | 100G/lane | 200G/lane |
|---|---|---|
| 波特率 | 53.125 GBaud | 106.25 GBaud |
| 1/4 速率 VCO | 53.125÷4 = 13.3 GHz | 106.25÷4 = 26.6 GHz |
| 1/8 速率 VCO | 53.125÷8 = 6.6 GHz | 106.25÷8 = 13.3 GHz |
| 实际选择 | 7 GHz(~1/8)或 14 GHz(1/4) | 28 GHz(1/4 速率) |
| VCO 类型 | RVCO 可以(<15 GHz) | 必须 LC-VCO |
100G/lane 在 1/4 速率下只需 13 GHz,RVCO 能搞定——所以设计师有"选 7 GHz 还是 14 GHz"的自由度。
200G/lane 在 1/4 速率下需要 28 GHz,已超出 RVCO 极限。如果它也想用 1/8 速率降到 13 GHz 呢?理论上可以,但 1/8 速率意味着最后一级 MUX 是 8:1——8 相时钟选通、抖动累积、面积代价都远超 4:1,工程上不划算。所以 ISSCC 2025 方案选择了 1/4 速率 + 28 GHz LC-VCO,是功耗、面积、复杂度的最优折中。
这就是为什么 100G/lane 有"7~14 GHz"的区间,而 200G/lane 被"锁"在 28 GHz——不是不想降,是降不下去(RVCO 跑不到)也不敢降太多(MUX 级数爆炸)。
问题三:7 GHz 用 RVCO,28 GHz 为什么要换 LC-VCO?
这不是"想换",而是物理上不得不换——两种 VCO 的工作频率和噪声特性完全不同:
| 特性 | RVCO(环形振荡器) | LC-VCO(LC 振荡器) |
|---|---|---|
| 结构 | 奇数级反相器首尾相连成环 | 电感 L + 电容 C 谐振槽 |
| 典型频率 | < 10 GHz | 10 ~ 40+ GHz |
| 最大频率 | 受反相器延迟限制,~15 GHz 封顶 | 由 LC 谐振决定,可达毫米波 |
| 相位噪声 | 较差(每级反相器贡献噪声) | 优秀(高 Q 值谐振滤波) |
| 面积 | 小(仅晶体管) | 大(需片上螺旋电感) |
| 功耗 | 低 | 较高 |
| 适用场景 | 100G/lane(≤10 GHz 时钟) | 200G/lane(28 GHz 时钟) |
RVCO 的频率天花板:环形振荡器的振荡频率 = 1 / (2N × t_pd),其中 N 是级数,t_pd 是单级延迟。28nm CMOS 的单级延迟约 10~15 ps,即便只用 3 级(最小环),最高也只能跑到 ~15 GHz。7 GHz 是 RVCO 的舒适区,28 GHz 已超出其物理极限——必须改用 LC-VCO。
LC-VCO 的噪声优势在 200G 中不可替代:106.25 GBaud 下 UI 仅 9.4 ps,时钟抖动预算极紧(<100 fs RMS)。RVCO 的相位噪声在 28 GHz 下会急剧恶化,而 LC-VCO 靠高 Q 值电感 + 二次谐波 LC 滤波器可将相位噪声压到极低。ISSCC 2025 方案实测:3MHz~奈奎斯特积分抖动仅 48 fs RMS。
完整对比:两代芯片的时钟架构
━━━ 100G/lane(56 GS/s,CAS 2022,28nm)━━━
RVCO 7 GHz → [8相] → T/H 28GS/s → [÷8] → 875MHz → [64相移位] → 64×SAR
↓
片内最高:7 GHz ✓
特点:全靠 RVCO + 分频 + 多相,无需 LC 谐振器,面积小功耗低
━━━ 200G/lane(112 GS/s,ISSCC 2025,5nm)━━━
LC-VCO 28 GHz → [4相@28GHz] → TX 最后级 4:1 MUX → 112 GBaud 串行输出
│ ↓
│ 片内最高:28 GHz
│
└→ [÷4] → 7 GHz → [4相] → T/H 28GS/s → [÷8] → 875MHz → 128×SAR
↓
ADC 侧最高仅 7 GHz(由 VCO 分频得到)
特点:VCO 必须用 LC 型(RVCO 跑不到 28GHz),TX 侧直接用 28GHz 4:1 MUX,
ADC 侧分频到 7GHz 驱动 T/H(与 100G 方案频率相同但噪声更低)
一个容易被忽略的细节:200G/lane 的 ADC 侧 T/H 采样时钟其实仍然是 7 GHz(28 GHz ÷ 4 分频得到,4 相 × 7 GHz = 28 GS/s 第一级等效采样)——和 100G/lane 的 7 GHz 一模一样!区别在于 100G/lane 的 7 GHz 由 RVCO 直接产生(噪声较高),200G/lane 的 7 GHz 由 28 GHz LC-VCO 分频得到(噪声更低)。28 GHz 这个最高时钟只在 TX 侧的最后一级 MUX 上出现,ADC 侧并不需要。
总结:7 GHz → 28 GHz 的三大根因
| 根因 | 说明 |
|---|---|
| ① 串行化数学约束 | 波特率翻倍到 106 GBaud,最后一级 4:1 MUX 要求时钟 ≥ 106÷4 = 28 GHz。100G/lane 同架构只需 53÷4 = 14 GHz(实际 7~14 GHz) |
| ② RVCO 物理天花板 | 环形振荡器在 28nm/5nm 工艺下最高 ~15 GHz,跑不到 28 GHz。必须改用 LC-VCO(LC 谐振可达 40+ GHz) |
| ③ 抖动预算收紧 | UI 从 18.8 ps 缩到 9.4 ps,时钟抖动预算减半。LC-VCO 的高 Q 值谐振可将相位噪声压到 RVCO 无法企及的水平(48 fs RMS),这是 200G 信号完整性的硬要求 |
本质:这不是"设计师选择把时钟调高",而是波特率翻倍后,串行化电路的拓扑结构在物理上要求最后一级 MUX 时钟达到 28 GHz,而 RVCO 又在物理上无法提供这个频率——两条物理约束叠加,迫使架构从 RVCO 切换到 LC-VCO。这也是 200G DSP 芯片面积更大、功耗更高的原因之一:LC-VCO 需要片上电感,占据可观面积。
DAC 端的变化:
| 参数 | 100G/lane DAC | 200G/lane DAC |
|---|---|---|
| 分辨率 | 6~8 bit | 8 bit(6 二进制 + 2 热码位) |
| 交错结构 | 4 相 | 4 相(@28 GHz 时钟) |
| TX FIR 预加重 | ~5 抽头 | 10 抽头(覆盖 30 UI) |
| TX SNDR | ~33 dB | 36.1 dB @212.5G / >39 dB @106.25G |
6.4 GearBox 8:4:从"可选"变成"主流实现"
在 100G/lane 方案(DR8/SR8)中,电口 8 lane 对应光口 8 lane,DSP 是 8:8 直通 retimer,GearBox 可省略。
但在 200G/lane 方案(FR4)中,电口仍然是 8×106.25G(112G SerDes),光口只有 4 lane——这是因为主机侧交换 ASIC 的 SerDes 尚未普及 224G,仍是 112G。主流实现中,DSP 内部完成 8:4 GearBox 变速:
Host 侧 (8×106.25G PAM4, 53.125 GBaud/lane)
│
▼
┌─────────────────────────────┐
│ Tx DSP │
│ [8:4 GearBox 变速] │ ← 将 8 条 53.125 GBaud 流
│ │ 重组为 4 条 106.25 GBaud 流
│ [Gray编码 → DAC → PAM4] │
└──────────┬──────────────────┘
│
▼ 4×212.5 Gbps PAM4 (106.25 GBaud)
激光器 → 4λ CWDM4 → 光纤
GearBox 的本质:在比特域把 8 条并行比特流重新分组、再串行化为 4 条更高速的比特流。这不是简单的"两两合并"——还需处理通道对齐、FEC 码字边界重整、抖动重定时。GearBox 模块的功耗和延迟在 200G DSP 中占比显著。
接收方向则相反:4 条 106.25 GBaud 光信号 → ADC → 均衡 → 判决 → 比特域 → 4:8 GearBox 拆分为 8 条 53.125 GBaud 电信号 → DAC → 输出给主机。
6.5 OSNR 恶化 ~3 dB 与级联 FEC
OSNR 恶化原因:波特率翻倍后,接收机噪声带宽也翻倍,而信号功率不变 → OSNR 下降约 3 dB:
$$\Delta \text{OSNR} = 10 \cdot \log_{10}\left(\frac{B_{new}}{B_{old}}\right) = 10 \cdot \log_{10}(2) \approx 3 \text{ dB}$$
100G/lane 的 RS(544,514) KP4 FEC 纠错门限约 2.4×10⁻⁴,在 200G/lane 的 OSNR 下已不够用——需要更强的 FEC。
两种 FEC 升级方案(MSA 白皮书定义):
| 方案 | 策略 | NCG(净编码增益) | 延迟 | 功耗 | 适用性 |
|---|---|---|---|---|---|
| Terminated FEC(终止式) | 完全终止 KP4,替换为开销更大的新 FEC | 更高 | 较大 | 较高 | 信道条件差 |
| Concatenated FEC(级联式) | 保留 KP4 作外码,增加新内码 | 次之 | 更小 | 更低 | 800G-FR4 首选 |
级联 FEC 结构(800G-FR4 推荐):
比特流 → [外码: RS(544,514) KP4] → [内码: 低延迟 Hamming/RS] → 调制传输
↑
新增的封装层 FEC(FECi)
纠错门限提升至 ~2×10⁻³
级联方案优势:KP4 由主机端到端负责(host-to-host),模块 DSP 仅在 KP4 之上"封装"一层低功耗、低延迟的内码(FECi),专门压制光链路引入的突发误码。这样既不破坏端到端 FEC 透明性,又获得了额外 ~3 dB 编码增益来抵消 OSNR 恶化。IEEE 802.3dj 标准已采纳此级联 FEC 机制。
6.6 均衡算法升级:MLSE/MLSD 的引入
100G/lane 的均衡主流方案是 CTLE + FFE + DFE(抽头数适中),在 53.125 GBaud 下足以打开眼图。
200G/lane 在 106.25 GBaud 下面临更严重的信道带宽限制和符号间干扰(ISI)——特别是当光/电器件带宽不足 56 GHz 时,残余 ISI 使得常规 FFE/DFE 无法收敛。MSA 的实验结论是:
"当新 FEC 阈值设置为 2×10⁻³ 时,接收机灵敏度可达标——但需要 MLSE(最大似然序列估计)来补偿通道带宽限制引起的过度 ISI。"
MLSE/MLSD 与 FFE/DFE 的对比:
| 均衡器 | 原理 | 复杂度 | 100G/lane | 200G/lane |
|---|---|---|---|---|
| FFE | 前馈横向滤波,线性补偿 | 低 | 主力(~20 抽头) | 主力(29 抽头) |
| DFE | 判决反馈,消除后标 | 中 | 1~5 抽头 | 1 抽头推测式 |
| 浮动滤波器 | 覆盖远端反射 | 中 | 可选 | 3 组×4 抽头(覆盖 100 UI) |
| MLSE/MLSD | 序列检测,全局最优判决 | 高 | 一般不用 | 可能必需 |
MLSE(Maximum Likelihood Sequence Estimation)不是逐符号独立判决,而是考察一串符号序列的联合概率,选最可能的序列——对带宽受限导致的严重 ISI 有显著优势。代价是计算复杂度随记忆长度指数增长,功耗高。ISSCC 2025 的 224G 收发器将其作为可选模块:常规信道用 FFE+DFE,长距/高损耗信道开启 MLSD 获取额外余量。
MSA 的关键结论:若未来 100 GBaud 光器件带宽能力低于预期,FR4 方案就必须使用 MLSE;若器件带宽达标(>56 GHz),则纯 FFE 均衡即可满足要求。MLSE 是 200G/lane 的"保险阀"。
6.7 带宽需求:>56 GHz 的器件挑战
奈奎斯特频率从 26.56 GHz 翻倍到 53.13 GHz,所有光/电器件的模拟带宽必须 >56 GHz:
| 器件 | 100G/lane 带宽需求 | 200G/lane 带宽需求 | 实现路径 |
|---|---|---|---|
| PD(光电二极管) | >28 GHz | >56 GHz | 低寄生电容设计 |
| TIA | >28 GHz | >56 GHz | 宽带化设计 |
| 调制器(EML/SiPh) | >28 GHz | >56 GHz | 硅光/InP 集成 |
| ADC 跟踪带宽 | >28 GHz | >60 GHz | Level-1 采样网络优化 |
| DRV(驱动器) | >28 GHz | >56 GHz | 倒装共封装(方案 B) |
MSA 白皮书指出:发射端有两种封装方案——方案 A(DRV 与 EML 紧靠)和方案 B(DRV 与 DSP 共封装,倒装设计)。方案 B 可更好保证 >56 GHz 带宽,是 200G/lane 的优选。
6.8 200G/lane DSP 数据流(与 100G/lane 对照)
下图标红 200G/lane 与 100G/lane 的关键差异点:
发送方向(800G-FR4):
Host 8×106.25G PAM4 (53.125 GBaud/lane)
│
▼
┌──────────────────────────────────────────────────┐
│ 200G/lane Tx DSP │
│ │
│ [CTLE] → [ADC 53GS/s] → [FFE/DFE] → [判决+解码] │ ← host 侧同 100G
│ │
│ ═══ 比特域 ═══ │
│ [重定时] → [FEC处理] → ★[GearBox 8:4]★ → [对齐] │ ← ★关键差异★
│ │
│ ═══ 返回符号域 ═══ │
│ [Gray编码] → ★[TX FFE 10抽头]★ → ★[DAC 106GS/s]★│ ← ★采样率翻倍★
│ │
│ ★4相交错@28GHz★ ★可选MLSE预失真★ │
└──────────────────┬───────────────────────────────┘
│
▼ 4×212.5G PAM4 (106.25 GBaud)
★级联FEC已编码★ ★>56GHz带宽器件★
激光器 → CWDM4 → 光纤
接收方向(800G-FR4):
光纤 → 4λ CWDM4 → PD → TIA (>56GHz带宽)
│
│ 4×212.5G PAM4 (106.25 GBaud, OSNR 恶化3dB)
▼
┌──────────────────────────────────────────────────┐
│ 200G/lane Rx DSP │
│ │
│ ★[CTLE 宽带]★ → ★[ADC 106GS/s, 112路交织]★ │ ← ★采样率翻倍★
│ │ │
│ ▼ │
│ ★[FFE 29抽头 + DFE + 浮动滤波器]★ │ ← ★均衡增强★
│ │ │
│ ▼ │
│ ★[可选 MLSE/MLSD]★ → [判决+Gray解码] │ ← ★序列检测★
│ │
│ ═══ 比特域 ═══ │
│ ★[级联FEC解码: 内码→KP4]★ → ★[GearBox 4:8]★ │ ← ★FEC+变速★
│ │ │
│ ▼ │
│ [重定时] → [Gray编码] → [DAC 53GS/s] → 输出 │ ← host 侧同 100G
└──────────────────┬───────────────────────────────┘
│
▼ 8×106.25G PAM4 → 交换机 ASIC
6.9 为什么 200G/lane 更难做——本质原因总结
| 难点 | 根因 | 量化 |
|---|---|---|
| ADC/DAC 采样率翻倍 | 波特率翻倍 → 等效采样率 106 GS/s | 交织路数 64→112,片内时钟 7G→28 GHz |
| OSNR 恶化 3 dB | 噪声带宽翻倍,信号功率不变 | 需级联 FEC 补偿 |
| 器件带宽 >56 GHz | 奈奎斯特频率翻倍 | PD/TIA/EML/DRV 全链路带宽翻倍 |
| ISI 加剧 | UI 从 18.8 ps 缩到 9.4 ps | 可能需 MLSE 序列检测 |
| GearBox 必选 | 电口 112G、光口 224G 不对等 | 8:4 变速增加延迟和功耗 |
| 功耗激增 | 采样路数+均衡复杂度+FEC 全增加 | DSP 功耗 5-7W → 8-10W+,需 3nm 工艺 |
核心洞察:200G/lane 的难度不在"PAM4 调制变了"(调制没变,还是 PAM4),而在于波特率翻倍引发的连锁反应——采样率翻倍要求重新设计 TI-ADC 交织架构,带宽翻倍逼近器件物理极限,OSNR 恶化需要级联 FEC,ISI 加剧需要 MLSE。每一个环节都是硬骨头。这也是为什么 800G-FR4(4×200G)比 800G-DR8(8×100G)量产更晚、成本更高的根本原因。
本报告基于 IEEE 802.3df 标准、SerDes 时钟设计技术文档及行业拆解分析整理,聚焦 800G 光模块中 DSP 的参考时钟设计与输入输出速率关系两个核心问题。