高级搜索

留言板

尊敬的读者、作者、审稿人, 关于本刊的投稿、审稿、编辑和出版的任何问题, 您可以本页添加留言。我们将尽快给您答复。谢谢您的支持!

姓名
邮箱
手机号码
标题
留言内容
验证码

AI赋能的实时音频信源信道联合编码研究

周通 陈宏智 许佳龙 孙鹏 姜大洁 刘健康

周通, 陈宏智, 许佳龙, 孙鹏, 姜大洁, 刘健康. AI赋能的实时音频信源信道联合编码研究[J]. 电子与信息学报. doi: 10.11999/JEIT260379
引用本文: 周通, 陈宏智, 许佳龙, 孙鹏, 姜大洁, 刘健康. AI赋能的实时音频信源信道联合编码研究[J]. 电子与信息学报. doi: 10.11999/JEIT260379
ZHOU Tong, CHEN Hongzhi, XU Jialong, SUN Peng, JIANG Dajie, LIU Jiankang. Research on AI-Enabled Real-Time Audio Joint Source-Channel Coding[J]. Journal of Electronics & Information Technology. doi: 10.11999/JEIT260379
Citation: ZHOU Tong, CHEN Hongzhi, XU Jialong, SUN Peng, JIANG Dajie, LIU Jiankang. Research on AI-Enabled Real-Time Audio Joint Source-Channel Coding[J]. Journal of Electronics & Information Technology. doi: 10.11999/JEIT260379

AI赋能的实时音频信源信道联合编码研究

doi: 10.11999/JEIT260379 cstr: 32379.14.JEIT260379
详细信息
    作者简介:

    周通:女,现任vivo通信研究院预研专家,研究方向为通信与AI融合技术

    陈宏智:男,现任vivo通信预研工程师,研究方向为通信与AI融合技术和AI感知辅助通信.

    许佳龙:男,现任vivo通信研究院预研工程师,研究方向为基于AI的联合信源信道编码,基于AI的无线通信物理层技术

    孙鹏:男,高级工程师,研究方向为massive MIMO,AI等

    姜大洁:男,高级工程师,现任vivo通信研究院预研总监,研究方向为通感一体化、AI与通信结合等

    刘健康:男,现任vivo通信研究院验证专家,研究方向为数据面,IoT-NTN,语音AI Codec等

    通讯作者:

    周通 tong.zhou@vivo.com

  • 中图分类号: TN926.1

Research on AI-Enabled Real-Time Audio Joint Source-Channel Coding

  • 摘要: 目前,第三代合作伙伴计划(3rd Generation Partnership Project, 3GPP)的业务与系统技术规范组第4工作组(TSG SA Working Group 4, SA4) 已经开始研究基于人工智能(Artificial Intelligence, AI)的语音编解码器。本文首次以3GPP地球静止轨道(Geostationary Earth Orbit, GEO)语音典型的物理层参数配置与目前SA4正在研究的Descript 音频编解码器(Descript Audio Codec, DAC)作为评估基线,保证了基线结果的公平性,并首次提出了总功率限制的DAC信源信道调制联合优化方案、恒模限制的DAC信源信道调制联合优化方案和DAC信源信道联合编解码方案。在语音质量可接受的前提下,所提方案相比于基线方案有2.5 dB~4 dB的覆盖增益。希望为GEO语音的后续研究提供有益思路。
  • 图  1  应用层DAC与物理层传输方案的处理流程

    图  2  提出3种方案的处理流程

    图  5  提出方案1、2与QPSK的PAPR CCDF对比

    图  3  基线方案2 DAC-物理层无信道编码方案的处理流程

    图  4  提出方案与基线方案的信噪比与PESQ对比

    表  1  仿真参数设置

    参数 基线
    方案1
    基线
    方案2
    总功率限制
    DAC-
    JSCCM
    恒模
    限制
    DAC-
    JSCCM
    DAC-
    JSCC
    应用层输出
    (N=64)
    N比特 3N
    比特
    3N /2
    复数
    3N /2
    复数
    3N比特
    物理层调制方式 QPSK QPSK QPSK
    物理层信道编码 1/3
    Turbo
    1/3
    训练信噪比
    (dB)
    [–5,10) [–5,10) [–5,10)
    DAC下采样输出维度 1024 1024 192 96 192
    RVQ码本数 8 24
    码本大小 256 256
    下载: 导出CSV

    表  2  信噪比与误块率表(64比特长度,1/3 Turbo编码)

    信噪比(dB) 误块率
    –6 1
    –5 1
    –4 1
    –3 0.925
    –2 0.665
    –1 0.236
    0 0.0464
    1 0.0039
    2 0.0004
    3 0
    4 0
    5 0
    6 0
    7 0
    下载: 导出CSV
  • [1] 周通, 姜大洁, 谭俊杰, 等. 语义通信的用例、挑战与标准化影响浅析[J]. 移动通信, 2025, 49(7): 2–11. doi: 10.3969/j.issn.1006-1010.20250522-0001.

    ZHOU Tong, JIANG Dajie, TAN Junjie, et al. A survey of semantic communication: Use cases, open challenges, and standardization trends[J]. Mobile Communications, 2025, 49(7): 2–11. doi: 10.3969/j.issn.1006-1010.20250522-0001.
    [2] OPPO. 基于信源信道联合编码的CSI反馈[R]. IMT-2030-Semantic_2024004, 2024. (查阅网上资料, 未找到本条文献信息, 请确认).
    [3] OPPO. 信道与无线环境语义通信_基于联合信源信道编码的CSI反馈[R]. IMT-2030-Semantic_2024036, 2024. (查阅网上资料, 未找到本条文献信息, 请确认).
    [4] 小米. 面向CSI反馈的信道估计与联合信源信道编码的联合设计[R]. IMT-2030-Semantic_2024056, 2024. (查阅网上资料, 未找到本条文献信息, 请确认).
    [5] YANG Ke, WANG Sixian, DAI Jincheng, et al. SwinJSCC: Taming swin transformer for deep joint source-channel coding[J]. IEEE Transactions on Cognitive Communications and Networking, 2025, 11(1): 90–104. doi: 10.1109/TCCN.2024.3424842.
    [6] GUO Jiangyuan, CHEN Wei, SUN Yuxuan, et al. VideoQA-SC: Adaptive semantic communication for video question answering[J]. IEEE Journal on Selected Areas in Communications, 2025, 43(7): 2462–2477. doi: 10.1109/JSAC.2025.3559160.
    [7] TUNG T Y and GÜNDÜZ D. DeepWiVe: Deep-learning-aided wireless video transmission[J]. IEEE Journal on Selected Areas in Communications, 2022, 40(9): 2570–2583. doi: 10.1109/JSAC.2022.3191354.
    [8] BOURTSOULATZE E, KURKA D B, and GÜNDÜZ D. Deep joint source-channel coding for wireless image transmission[J]. IEEE Transactions on Cognitive Communications and Networking, 2019, 5(3): 567–579. doi: 10.1109/TCCN.2019.2919300.
    [9] YILMAZ S F, NIU Xueyan, BAI Bo, et al. High perceptual quality wireless image delivery with denoising diffusion models[C]. IEEE Conference on Computer Communications Workshops, Vancouver, Canada, 2024: 1–5. doi: 10.1109/INFOCOMWKSHPS61880.2024.10620904.
    [10] DAI Jincheng, WANG Sixian, TAN Kailin, et al. Nonlinear transform source-channel coding for semantic communications[J]. IEEE Journal on Selected Areas in Communications, 2022, 40(8): 2300–2316. doi: 10.1109/JSAC.2022.3180802.
    [11] WENG Zhenzi, QIN Zhijin, and LI G Y. Robust semantic communications for speech transmission[C]. 2025 IEEE International Conference on Acoustics, Speech and Signal Processing, Hyderabad, India, 2025: 1–5. doi: 10.1109/ICASSP49660.2025.10889160. (查阅网上资料,未能确认本条文献修改是否正确,请确认).
    [12] HAN Tianxiao, YANG Qianqian, SHI Zhiguo, et al. Semantic-preserved communication system for highly efficient speech transmission[J]. IEEE Journal on Selected Areas in Communications, 2023, 41(1): 245–259. doi: 10.1109/JSAC.2022.3221952.
    [13] WENG Zhenzi, QIN Zhijin, TAO Xiaoming, et al. Deep learning enabled semantic communications with speech recognition and synthesis[J]. IEEE Transactions on Wireless Communications, 2023, 22(9): 6227–6240. doi: 10.1109/TWC.2023.3240969.
    [14] CHEN Xiaojiao, WANG Jing, XU Liang, et al. A perceptually motivated approach for low-complexity speech semantic communication[J]. IEEE Internet of Things Journal, 2024, 11(12): 22054–22065. doi: 10.1109/JIOT.2024.3378779.
    [15] 3GPP. 3GPP TS 23.501 System architecture for the 5G System (5GS)[S]. 2025. (查阅网上资料, 未找到出版信息, 请补充)(查阅网上资料, 未能确认本条文献修改是否正确, 请确认).
    [16] 3GPP. 3GPP TS 38.323 Packet data convergence protocol (PDCP) specification[S]. 2025. (查阅网上资料, 未找到出版信息, 请补充)(查阅网上资料, 未能确认本条文献修改是否正确, 请确认).
    [17] IMT-2030(6G)推进组. 面向6G的语义通信技术研究报告[M]. 北京: IMT-2030(6G)推进组, 2025. (查阅网上资料, 未找到对应的英文翻译, 请补充).
    [18] Descript. Descript-audio-codec[EB/OL]. https://github.com/descriptinc/descript-audio-codec, 2026.
    [19] 3GPP. 3GPP TR 26.940 Study on ultra low bit rate speech codecs[S]. 2026. (查阅网上资料, 未找到出版信息, 请补充)(查阅网上资料, 未能确认本条文献修改是否正确, 请确认).
    [20] 3GPP. 3GPP TS 36. 212 Multiplexing and channel coding[S]. 2025. (查阅网上资料, 未找到出版信息, 请补充)(查阅网上资料, 未能确认本条文献修改是否正确, 请确认).
    [21] ETSI. ETSI TS 136 213 V19.1. 0 (2025-10) Physical layer procedures[S]. 2025. (查阅网上资料, 未找到出版信息, 请补充)(查阅网上资料, 未能确认本条文献修改是否正确, 请确认).
    [22] OpenDataLab. VCTK[EB/OL]. https://opendatalab.com/OpenDataLab/VCTK, 2026.
    [23] Common voice[EB/OL]. https://commonvoice.mozilla.org/zh-CN, 2026.(查阅网上资料,请补充作者信息).
    [24] Librispeech[EB/OL]. https://huggingface.co/datasets/openslr/librispeech_asr, 2026. (查阅网上资料,请补充作者信息).
    [25] ITU. ITU-T P. 863-2018 Perceptual objective listening quality prediction[S]. 2018. (查阅网上资料, 未找到出版信息, 请补充).
  • 加载中
图(5) / 表(2)
计量
  • 文章访问数:  29
  • HTML全文浏览量:  7
  • PDF下载量:  0
  • 被引次数: 0
出版历程
  • 修回日期:  2026-07-08
  • 录用日期:  2026-07-08
  • 网络出版日期:  2026-07-22

目录

    /

    返回文章
    返回