1. 概述
大语言模型(LLMs)在多语言翻译领域取得了显著进展,但普遍存在系统性的“跨语言冗长偏差”(Verbosity Bias),导致译文往往过于啰嗦,难以满足字幕翻译、视频配音等对时间预算(Time Budget)有严格要求的场景。现有的提示工程等难以在语义忠实度与长度约束之间取得平衡。为此,本研究首先提出了Sand-Glass基准测试,专门用于评估音节级长度约束下的翻译表现。随后,我们提出了HOMURA强化学习框架,通过 KL 正则化目标函数结合创新的“动态音节比例奖励”,显式优化语义保留与时间合规性之间的权衡。实验结果表明,HOMURA 能够精准“驯服”输出长度,在尊重不同语言密度差异的同时,显著优于主流 LLM 基线模型,实现了高质量、高合规性的时间受限翻译。当前HOMURA已经大规模应用于bilibili视频原声翻译场景中,为实现高质量、高合规性的时间受限翻译提供了可行的技术路径。论文链接:https://arxiv.org/pdf/2601.10187
HOMURA 已被 EMNLP 2026 接收为 Oral(口头报告)!
HOMURA 的音节控制方法也应用于哔哩哔哩 Index LLM 团队推出的 Index-Translate 系列。该系列的文本翻译模型覆盖 150 种语言,提供 2B、9B 和 35B-A3B(preview)三种规模,支持术语、格式、风格与上下文指令,并扩展出语音翻译模型 Index-Echo、音节控制模型 Index-Homura 和长文档翻译模型 Index-NativeLong。其中,Index-Homura 根据指定音节数调整译文,为字幕和配音等时间受限场景提供长度控制能力。
在线 Demo :https://index-translate.bilibili.com/
GitHub:https://github.com/bilibili/Index-Translate
Hugging Face:https://huggingface.co/collections/IndexTeam/index-translate
免费 API:https://github.com/bilibili/Index-Translate#option-1-free-online-api-zero-gpu-setup
Index-Translate 技术报告:https://arxiv.org/abs/2609.40181
2. 研究背景与挑战 (Background & Challenges)
随着大语言模型(LLMs)的飞速发展,其在神经机器翻译(NMT)中表现出了卓越的语义准确性。然而,这种语言能力伴随着一种系统性的**“跨语言冗长偏差”**。
如上图所示,论文提出的**回环膨胀率(Roundtrip Expansion Ratio)揭示了一个关键问题:即使语义内容保持不变,LLM 生成的译文往往比源话语显著更长。传统的评估指标往往忽略了这一点,但这种“喋喋不休”的特性在时间受限(Time-Constrained)**的场景(如字幕翻译、视频配音及同声传译)中是致命的。在这些场景下,译文长度构成了一个刚性的“时间预算”,直接决定了输出内容能否与画面或原声同步。
从信息论的角度来看,时间预算充当了严格的“速率约束”。模型必须在有限的音节配额内,通过词汇整合和句法重构,将最大化的信息密度压缩进最短的长度中。然而,现有的 LLM 很难自发实现这种平衡。这不仅是因为语言间的密度差异(如德语、西班牙语天然比中文占空间),更深层的原因在于 LLM 的对齐过程——现有的奖励模型往往存在“长度偏差”,倾向于给更长、更详细的回答打高分。因此,如何“驯服”模型的长度,使其在不损失核心语义的前提下满足严苛的时间约束,成为了多语言本地化领域亟待解决的建模挑战。
本文核心贡献总结:
诊断分析:系统量化了 LLM 翻译中的冗长偏差,并提出了回环膨胀率等跨语言诊断指标。
基准构建:引入了 Sand-Glass 数据集,通过音节级预算模拟真实的配音与字幕约束场景。
方法创新:提出了 HOMURA 强化学习框架,有效平衡了严苛的长度约束与语义保留。
3.基准测试与冗长偏差分析 (Pilot Study)
为了量化时间受限场景下的翻译挑战,本研究构建了Sand-Glass 基准测试,并对大语言模型的冗长偏差进行了深入诊断。
3.1 Sand-Glass 基准与音节度量
Sand-Glass 是一个源自真实视频语料的翻译基准。不同于通用翻译数据集,它引入了**音节(Syllable)**作为时间的代理指标。
等信息量原则(Iso-Information Principle):科学研究表明,虽然不同语言的音节速率(SR)差异巨大(如西班牙语极快,汉语较慢),但全人类的信息传输速率恒定在约 39 bits/s。
语言密度差异:如下表所示,汉语的信息密度(0.94)远高于西班牙语(0.63)。这意味着从汉语翻译到西班牙语时,为了保持语义完整,译文长度天然需要膨胀约 1.49 倍。
3.2 诊断指标:回环膨胀率
传统的“正向膨胀率”无法区分译文变长是因为“语言本身的密度差异”还是因为“模型废话多”。为此,论文提出了回环膨胀率(Roundtrip Expansion Ratio):
1.将源文翻译为译文。
2.将译文回译为源语言。
3.计算膨胀率:
结论:在理想状态下,同语言对比的回环膨胀率应接近 1.0。但在 Sand-Glass 上的测试显示(见下图),主流模型的 $\rho_{rtp}$ 普遍大于 1。这证明了 LLM 存在系统性的、与语言种类无关的冗长倾向。(上图展示了大模型翻译下的语言膨胀分布图)
3.3 校准目标区间
为了打破这种偏差,本研究对比了“理论膨胀率”与“LLM 实际膨胀率”,发现 LLM 普遍存在 30%-40%的额外冗余(Bias)。
基于此,HOMURA 框架设定了严苛的目标音节区间(Target Bounds):
英语 (En):设定为 [0.8, 0.9](强制模型进行摘要式精简)。
德语 (De):设定为 [0.9, 1.0]。
西班牙语 (Es):将原本1.84倍的音节比大幅压低至 [1.0, 1.1]。
这种设定强制模型通过改写(Rewriting)而非简单删减,在极短的时间预算内实现信息的最大化对齐。
4. HOMURA 框架设计 (Methodology)
本研究将音节级控制建模为“可控文本生成”任务,目标是在满足严格音节比例约束的同时,最大化翻译质量。
4.1 KL 正则化目标与 GRPO 优化
为了实现精准控制,HOMURA 采用了基于KL 正则化的强化学习目标。其核心思想是:通过一个奖励函数 R(x,c,y) 鼓励模型满足长度约束,同时最大化模型翻译的生成质量。
优化算法:采用GRPO(Group Relative Policy Optimization)算法。该算法无需额外的 Critic 网络,通过在同一组样本内进行归一化来计算优势(Advantage),极大降低了计算开销,适合序列级别的奖励优化。
4.2 奖励机制设计 (Reward Design)
这是 HOMURA 能够精准“驯服”长度的关键。奖励函数由长度合规奖励和质量奖励两部分加权组成:
1. 动态音节比例奖励:
动态区间设定:基于前述的语言密度分级设定基础目标区间 [L_0, R_0]。
短句平滑处理:针对短句子(音节数少),微小的长度变化会导致比例剧烈波动(离散噪声)。本研究引入了动态缩放因子,对短句适度放宽下限。
平滑奖励函数:采用平方指数衰减函数而非简单的 0/1 判定,为优化过程提供连续的梯度引导,使模型逐渐向目标区间收敛。
2. 质量奖励:
为了确保压缩长度不会导致语义丢失或语句破碎,研究设计了两种质量评估路径:
基于准则的评估 (Rubric-based):
语义忠实度:利用回译(Back-translation)机制,将生成的译文重新翻译回源语言,通过计算其与原句的**嵌入向量相似度(Embedding Similarity)**来衡量语义保留程度。
语言流利度:使用大模型作为裁判,针对语法、可读性和语言一致性进行打分。
基于推理的评估 (Reason-based / GenRM):
通过训练一个专门的生成式奖励模型(GenRM),使其能够产生思维链(CoT)推理。该模型会先在内部进行回译和语义对比,再对流畅度做出判断,最后给出一个具备可解释性的二进制奖励信号。这种“先推理、后打分”的方式显著提升了奖励的鲁棒性。
5. 实验结果与分析 (Experimental Results)
本研究在 Sand-Glass 基准测试上对 HOMURA 进行了全面评估,并与 GPT-5、Claude-4.1 及 Gemini-pro-2.5 等主流模型进行了对比。
5.1 长度合规性与质量的权衡
实验结果表明,HOMURA 在满足严苛时间预算方面表现出显著优势。
精准的长度控制:相比于仅依靠提示词的模型,HOMURA 能够极高比例地将译文压缩在目标区间内。在英语、德语和西班牙语等多个语向中,HOMURA 的超限率(Over-length rate)远低于基线模型。
语义密度的提升:论文引入了语义密度指标,用于衡量单位音节内的语义价值。结果显示,HOMURA 在压缩长度的同时,保持了极高的语义保留率。这证明模型并非通过简单“删减”来缩短长度,而是通过**语义巩固(Semantic Consolidation)**实现了更高的信息密度。
5.2 强化学习过程中的行为分析
通过对训练过程的监控,我们观察到了模型策略的显著演变:
打破冗长先验(beta参数的影响):实验中一个重要的发现是,当 KL 惩罚系数 beta > 0 时,模型往往会陷入“保守陷阱”,不敢大幅度重构句子。而当 beta = 0 时,模型能够彻底摆脱基座模型的啰嗦倾向,学会更激进且高效的表达方式。
梯度范数与优化动量:监控曲线显示,HOMURA 在优化过程中保持了稳定的梯度更新,能够有效地向“率失真(Rate-Distortion)”的前沿边界移动。
5.3 “压缩墙”的发现(The Compression Wall)
研究进一步探测了语义压缩的物理极限,我们基于设计自动压缩寻找最低极限。
实验发现,对于语言对,存在一个“有效压缩阈值”(如中英翻译约为 0.49)。一旦压缩要求低于这个阈值,语义准确性会发生非线性崩塌。HOMURA 的优势在于它能够极其接近这一极限而依然保持译文的流利度。
5.4 质量-压缩权衡分析(Quality-Compression Trade-off)
为了深入探讨模型在不同长度限制下的表现,本研究从“率失真(Rate-Distortion)”视角分析了翻译质量与输出长度之间的权衡关系。
基线模型的局限性:如图所示,未经约束的基线模型通常聚集在“高质量、长文本”区域。虽然可以通过提示词迫使 LLM 缩短译文,但其翻译质量会随着压缩率的增加而剧烈下降。这表明普通 LLM 在降低“音节速率”时效率较低,难以在极短的预算内识别并保留核心语义信息。
HOMURA 的高效权衡:相比之下,HOMURA 展示了显著更高的率失真效率。在相同的音节预算下,HOMURA 的语义保真度显著优于基线;或者说,在保持相同质量水平的前提下,HOMURA 能实现更短的译文长度。
6. 结论 (Conclusion)
本研究深入探讨并解决了大语言模型(LLM)翻译中普遍存在的系统性“跨语言冗长偏差”,这一偏差是实现字幕翻译、视频配音等时间受限任务的主要障碍。
基准构建:本研究引入了Sand-Glass基准测试。该基准基于“等信息量原则(Iso-Information Principle)”,利用音节预算模拟真实世界的时间约束,为量化评价翻译的“时间可行性”提供了科学工具。
方法突破:提出了HOMURA强化学习框架。通过结合 KL 正则化目标函数与创新的“动态音节比例奖励”,该框架在无需参考译文的情况下,实现了极其严格的长度合规性,并显著提升了单位长度内的信息密度。
本研究不仅在工程上实现了精准的长度控制,更在理论上界定了语义压缩的边界(例如中英翻译中0.49的可行性阈值)。未来的工作将进一步验证该压缩边界在更多语言对中的普适性,并计划将 HOMURA 扩展至端到端语音翻译领域,探索语义与时长联合优化的更多可能性。
7. B站原声翻译效果展示
该功能依托 HOMURA 对时长的精准把控,生成了与原视频时间轴严格对齐的译文,从根本上解决了机器配音中‘音画不同步’或‘语速异常’的行业痛点,为用户带来了如同原生般的沉浸式视听体验。
https://www.bilibili.com/video/BV111BeBPEaD/?spm_id_from=333.337.search-card.all.click&vd_source=e946351224816c78650f22c3d26579ad
8. HOMURA 入选 EMNLP 2026 Oral 现场见
如果你也会参加 EMNLP,欢迎来听我们的oral、到poster现场交流,一起聊聊翻译、强化学习和多语言内容生产。
HOMURA 已被 EMNLP 2026 接收为 Oral(口头报告)。报告已安排在2026 年 10 月 27 日 09:00–10:30的 Machine Translation and Semantics session,地点F9-10。
我们也会参加Poster Session D(10 月 26 日 11:00–12:30,Hall H),以及WMT poster session,欢迎到现场交流。以上时间均为布达佩斯当地时间,具体安排请以 EMNLP 官方日程(https://2026.emnlp.org/program/)和 WMT 官方日程(https://www2.statmt.org/wmt26/program.html)为准。
现场还会发放精美谷子,欢迎来交流技术与使用体验,把喜欢的周边带回去。我们 EMNLP 见!
团队周边展示
-End-
作者丨Index LLM Team