Lecsync MT 1.7B V1

面向讲座与会议转录的 1.7B 翻译模型,支持前文与术语表。V1 正式版本,来自最后一次 V8 训练。

阅读论文 PDF · 下载 LaTeX 源码 · 模型仓库

优先适用 8 个源语种 → 中文(标记 ✓)。界面提供 59 种目标语言;各方向质量与前文、术语能力并不相同。

源语言
目标语言
Examples
当前片段 源语言 目标语言 前文(可选,一行一段,只放源语言) 术语表(可选,一行一条:ERD -> 实体关系图)

训练与适用范围

基于 LMT-60-1.7B,以 LoRA 和多语言回放训练 2 个 epoch。原始训练集 149,413 条,其中领域数据 99,433 条、回放数据 49,980 条;长度过滤后实际训练 149,042 条。

中文讲座任务覆盖英语、韩语、俄语、日语、德语、意大利语、西班牙语和法语。FLORES 语言遵从性探针不等于翻译准确率;传统蒙古文因退化已从界面移除,Javanese 未获 V8 回放训练。论文另含部分多语言方向的翻译质量结果,不能推广为全部 59 种语言的质量保证。

归档评测摘要

论文在相同的 6 组冻结输入上比较 V1、HY-MT2-1.8B 与 Qwen3.5-2B,每模型 2,341 条。下表是自动裁判的 V1 获偏好数 : 对手获偏好数,并非准确率;平局、不确定和错误见论文全表。

测试组 样本数 对 HY-MT2 对 Qwen3.5
Lecture 304 69 : 27 109 : 16
Context 486 124 : 43 199 : 35
Glossary 452 104 : 46 157 : 42
No context 200 33 : 22 54 : 16
WMT24 → 中文 300 47 : 92 123 : 41
Multitarget(混合年份) 599 68 : 314 232 : 108

V1 在部分中文业务组更受自动裁判偏好,HY-MT2 在多语言组更强。标准参考指标与裁判结果存在分歧;训练输入重合、重复开发评测与解码配置差异均在论文中分析。当前没有独立人工评测,也没有全面行业领先的结论。

演示版本: ab8091bf3fce317c8ef72b8a0749b557f34bccb1。线上适配器与论文 V8 epoch-2 适配器 SHA-256 一致,但两份合并导出的权重文件 SHA-256 不同,尚未验证张量或输出等价;表中结果属于论文归档导出。

作者

Han Lihli227@alumni.jh.edu
Yangjie Luoluo.engineer@mail.black-tom.com

论文 PDF · LaTeX 源码与聚合证据 · 完整版本说明

更新:2026-09-14。论文为作者初稿,尚未投稿或通过同行评审。