中国电信“智传网(AI Flow)”提出的生成式智能传输,并非单纯概念包装:其核心技术路线和部分极低码率实验结果具有较充分依据。但“0.02% 压缩率”和“感官无差别”不能理解为任意视频的 5000 倍无损压缩,而是面向感知与任务有效的生成式通信。
智传网(AI Flow)到底是什么
智传网是中国电信人工智能研究院(TeleAI)提出的生成式智能传输体系,其核心不是继续“把传统视频编码压得更狠”,而是 改变通信系统传输的信息对象 。
传统视频通信基本遵循:
原始视频 → H.264 / H.265 / H.266 等编码 → 比特流 → 网络传输 → 解码 → 视频
AI Flow 则更接近:
原始视频 → 语义 / 特征 / 运动信息提取 → Token / 紧凑表示 → 低码率网络传输 → 生成式模型 → 重建视频
也就是说,它利用 AI 模型的先验知识,在接收端“补全”大量没有显式传输的信息。
所谓“比特流向词元流转变”,真正含义是: 通信系统从传输完整数据,逐渐转向传输能够支撑目标任务的高价值信息。
从这个角度看,AI Flow 更接近“ 语义通信 + 生成式模型 + 通信系统 ”的融合。
“极低速率、感知近似无差异”的技术依据
目前公开资料中已经有几组代表性指标。
- 中国电信公开资料显示,在卫星等弱网环境下,AI Flow 视频传输带宽可控制在 14–144 Kbps 区间;
- 在相关应急通信测试中,展示了约 110 Kbps、720P 视频实时传输 的能力,并强调重建视频在清晰度、流畅度和业务效果上与原视频接近;
- TeleAI 的生成式视频压缩(GVC)论文进一步给出更极端实验结果:在特定视频和实验条件下,码率可达 0.005 bpp ,主要实验结果约为 0.008 bpp ;部分视频序列上,相对传统方法达到相近感知质量所需码率可大幅降低;
- 公开资料中还出现了 0.02% 压缩率 等极端指标。
这些数据共同说明:
在特定视频内容、特定模型和特定感知目标下,生成式视频传输确实能够进入传统视频编码难以达到的极低码率区间。
但必须明确区分:
“0.02% 的极端实验码率”与“14–144 Kbps 的实际弱网测试”是两个不同层次的指标。
前者主要证明技术的理论和实验潜力,后者更接近完整通信系统的工程验证。
因此,目前更有工程意义的证据是 百 Kbps 级视频传输 ,而不是简单强调“5000 倍压缩”。
为什么如此低的速率在技术上是可能的?
关键不在于 AI 找到了一个“违反信息论”的新压缩算法,而在于:
接收端已经拥有大量信息。
以固定摄像机持续拍摄一条道路为例。
传统编码器需要不断编码:车辆、道路、建筑、天空、光照、纹理、人物、运动……虽然 H.265 等编码器能利用帧间相关性减少重复数据,但仍需通过码流表达足够多的像素信息。
生成式传输则可以进一步利用:
固定摄像机 + 固定背景 + 历史帧 + 场景模型 + 生成模型
那么网络真正需要传输的主要是:
车辆出现 → 位置变化 → 速度变化 → 人物运动 → 局部视觉特征
接收端利用已有模型和历史状态,将这些信息重新生成完整画面。
因此:
传输信息量 < 最终呈现信息量
并不是系统“凭空创造信息”,而是:
📌 大量信息已经由模型、历史状态和共享先验承担
这正是生成式通信能够突破传统像素级编码码率限制的核心原因。
“0.02% 压缩率”究竟应该怎样理解?
如果把一段视频从 100 MB 变成 20 KB,却仍要求接收端逐像素、逐帧恢复原始视频,那么这种意义上的“5000 倍无损压缩”显然不成立。
AI Flow 的逻辑实际上是:
原始视频 ├─ 人眼真正需要的信息 ├─ 机器真正需要的信息 └─ 可以由模型预测的信息 ↓ 只传输前两类 → 接收端生成第三类
因此:
AI Flow 压缩的不是“原始信息本身”,而是“为了获得目标感知结果而必须通过网络显式传输的信息”。
这一区别非常关键。
- 如果目标是 人眼观看 ,某些像素级差异可以接受;
- 如果目标是 目标检测 ,只要目标位置、类别和运动状态准确即可;
- 如果目标是 事件识别 ,甚至不需要完整恢复视频,只需让接收端准确理解“发生了什么”。
因此,生成式通信的码率实际上与 任务目标 高度相关。
“感官无差别”是否意味着真的没有区别?
严格来说,不应理解为“无损”。
更准确的说法是:
主观感知近似无差异,或者感知质量接近原始视频。
例如原视频中一个人物拿着一个杯子。
AI 模型可能生成:
“一个人拿着一个杯子。”
在人眼看来,两幅画面可能几乎没有区别。但如果逐像素比较:
原始视频 ≠ AI 重建视频
甚至可能出现一些细节偏差,例如:
- 人脸细节变化
- 文字发生变化
- Logo 被重新生成
- 细小纹理变化
- 物体边缘发生变化
- 快速运动时出现生成误差
因此:
📌 感知等效 ≠ 数据等价
这也是 AI Flow 与 H.265 / H.266 等传统视频编码体系之间最根本的区别之一。
真正值得关注的是“模型先验成为通信系统的一部分”
传统通信系统可以简单描述为:
Source → Encoder → Bits → Network → Bits → Decoder → Source
而生成式通信则变成:
发送端: 视频 → Semantic Encoder → Token / Feature → 网络
接收端: Token / Feature → Generative Decoder + 历史状态 + 模型先验 → 视频
因此,通信系统实际上增加了一个过去没有的重要组成部分:
生成模型及其先验知识。
从这个意义上讲,AI Flow 并不是简单地“压缩得更厉害”,而是 把一部分原本需要由通信网络承担的信息传输任务,转移到了计算和存储上 。
可以表示为:
📌 Bandwidth ↔ Computation ↔ Memory
这也是生成式通信真正具有研究价值的地方。
这是否突破了 Shannon 信息论?
不能这样理解。
Token 最终仍然需要通过网络编码成 Bit:
Token → Binary Representation → Modulation → Physical Channel
因此 AI Flow 并没有从物理层面消除 Bit,也没有违反 Shannon 信道容量理论。
它真正改变的是:
通信系统究竟需要传输什么。
传统通信关注: 如何准确恢复数据
语义通信关注: 如何准确恢复信息含义
生成式通信进一步关注: 如何用最少通信资源获得有效感知或完成任务
因此更准确的说法不是:
“AI Flow 突破了信息论极限。”
而是:
AI Flow 突破了传统像素保真型视频传输模式的应用边界。
这两种表述的技术含义完全不同。
为什么监控、卫星和应急通信特别适合 AI Flow?
AI Flow 并不是对所有视频都同样有效。其优势最大的场景通常具有以下特征:
① 场景具有高度稳定性
例如:
固定摄像机 → 固定背景 → 有限运动目标
模型非常容易预测大量未变化的信息。
② 带宽非常昂贵
例如:
- 卫星通信
- 远洋通信
- 应急通信
- 空天地一体化通信
- 偏远地区通信
如果传统视频需要 1 Mbps,而生成式传输只需要 100 Kbps,那么牺牲一定计算资源换取 90% 的带宽节省,可能具有很高的经济价值。
③ 用户更关心“发生了什么”
监控视频往往不是为了逐像素分析,而是为了:
看清楚人、车、事件和运动。
这恰好与生成式通信的目标一致。
因此,AI Flow 目前最值得关注的商业价值,并不是马上替代互联网视频编码,而是:
在极端弱网条件下,把原本无法传输的视频变成“可用的视频”。
目前最大的工程限制是什么?
AI Flow 目前真正需要继续验证的,不是“能不能把码率做到很低”,而是能否同时满足:
📌 低带宽 + 低延迟 + 低功耗 高质量 + 高鲁棒性
这五个指标之间存在明显的 Trade-off。
① 计算成本
生成式视频重建显著依赖 AI 推理能力。
传统 H.265 解码可以在大量低功耗芯片上完成,而生成式视频解码需要更强的 AI 算力。
因此:
节省的是网络带宽,但增加的是计算资源。
② 实时性
生成式模型需要进行推理和生成,这可能增加端到端时延。
对于视频监控,问题可能不大;但对于远程操控、机器人、无人驾驶、实时互动等场景,则需要严格控制延迟。
③ 生成错误
传统视频解码的错误通常来自“数据损坏”。
生成式通信还可能出现“模型理解错了”,例如:
- • 原始:红色车辆 → 生成:黑色车辆
- • 原始:ABC123 → 生成:ABC128
对普通观看而言可能没有影响,但对于取证、工业检测、医学影像和高精度机器视觉而言,这种错误可能是不可接受的。
因此不能简单说 AI Flow 将取代 H.265/H.266
至少目前没有充分证据支持这一判断。
更可能出现的未来形态是:
AI Flow ├─ 极弱网 → 生成式传输 └─ 正常网络 → H.265 / H.266 ↓ 自适应选择
也就是说:
生成式传输更可能首先成为传统视频编码体系之外的一种新模式,而不是立即取代传统编码器。
特别是在正常宽带、移动互联网和视频平台场景中,H.265 / H.266 / AV1 等技术仍具有成熟的生态、硬件加速和确定性优势。
从运营商角度看,AI Flow 真正重要的不是“压缩率”
如果站在通信运营商的角度,AI Flow 真正值得关注的战略意义其实更深。
传统通信网络:
📌 传输数据
AI 通信网络:
📌 传输语义、Token、状态和任务信息
这意味着网络可能出现一个新的优化目标:
📌 Utility / Bit
即:
每一个 Bit 能够产生多少有效感知或智能价值。
未来甚至可以进一步演化为:
Bit/s → Token/s → Task/s → Inference/s → Intelligence/s
这意味着通信网络的价值评价体系可能从:
“能够传多少数据”
逐渐转向:
“能够以多低的通信成本产生多少有效智能。”
这可能比单纯的视频压缩技术本身更值得运营商关注。
对 AI Flow 的综合可信度评价
① AI Flow 是真实技术体系 |★★★★★
已有中国电信官方资料和论文支撑
② 采用生成式/语义传输 |★★★★★
技术路线明确
③ 通过计算换带宽 |★★★★★
核心机制成立
④ 14–144 Kbps 弱网视频 |★★★★☆
已有公开工程测试
⑤ 约 110 Kbps 传输 720P |★★★★☆
有实际演示/测试依据
⑥ <100 Kbps 传输 1080P |★★★☆☆
需要更多独立、可复现数据
⑦ 0.02% 极端压缩率 |★★★★☆
有论文实验依据,但属于特定条件
⑧ 普遍 5000 倍压缩 |★☆☆☆☆
不应由公开数据推导
⑨ 感知上接近原视频 |★★★★☆
与生成式通信目标一致
⑩ 像素级无损 |☆☆☆☆☆
技术目标本身就不是这个
⑪ 任意视频均适用 |★☆☆☆☆
泛化能力仍是主要问题
⑫ 已全面替代 H.265/H.266 |★☆☆☆☆
目前没有充分证据
⑬ 卫星/应急/监控应用价值 |★★★★★
与技术特点高度匹配
⑭ 成为未来通信新范式 |★★★★☆
技术方向具有较高战略价值
结论|可信,但必须重新定义“压缩”
综合来看,中国电信智传网 AI Flow 的核心技术并不是“AI 把视频无损压缩了 5000 倍”,而是:
通过语义提取、紧凑表示、模型先验和生成式重建,把“传输完整视频”转变为“传输足以生成目标感知结果的信息”。
因此,0.02% 等极端码率具有实验技术依据,14–144 Kbps 的百 Kbps 级弱网视频传输也已经具有公开工程验证基础;但这些结果不能简单推广为所有视频均可实现数千倍压缩。
从技术成熟度看,AI Flow 已经越过“纯概念验证”的阶段,但距离成为面向任意视频、任意网络和任意终端的通用通信技术仍有明显距离。
其近期最现实的价值,是在卫星、应急、远洋、监控、空天地一体化等带宽极度稀缺的场景中, 以计算和存储换取通信带宽 。
更值得关注的是其背后的范式变化:
📌 从“传输数据” → “传输信息” → “传输语义” → “传输任务所需的信息”
如果这一方向持续成熟,那么 AI Flow 对运营商的意义将不再只是“又一种视频压缩技术”,而可能意味着通信网络开始从面向比特的网络,逐步向面向语义、状态和智能任务的网络演进。
参考资料
[1] 智传网(AI Flow)赋能视联网,破解空天地海弱网场景高清视频传输难题
[2] 从“光改”“云改”走向“智改”:WAIC 2026 透视中国电信 AI 范式革命
[3] 小耳朵·听世界 68:超神奇!不用传视频,屏幕也能变出高清画面?
