Lecsync MT 1.7B V1
面向讲座与会议转录的 1.7B 翻译模型,支持前文与术语表。V1 正式版本,来自最后一次 V8 训练。
阅读论文 PDF · 下载 LaTeX 源码 · 模型仓库
优先适用 8 个源语种 → 中文(标记 ✓)。界面提供 59 种目标语言;各方向质量与前文、术语能力并不相同。
| 当前片段 | 源语言 | 目标语言 | 前文(可选,一行一段,只放源语言) | 术语表(可选,一行一条:ERD -> 实体关系图) |
|---|
训练与适用范围
基于 LMT-60-1.7B,以 LoRA 和多语言回放训练 2 个 epoch。原始训练集 149,413 条,其中领域数据 99,433 条、回放数据 49,980 条;长度过滤后实际训练 149,042 条。
中文讲座任务覆盖英语、韩语、俄语、日语、德语、意大利语、西班牙语和法语。FLORES 语言遵从性探针不等于翻译准确率;传统蒙古文因退化已从界面移除,Javanese 未获 V8 回放训练。论文另含部分多语言方向的翻译质量结果,不能推广为全部 59 种语言的质量保证。
归档评测摘要
论文在相同的 6 组冻结输入上比较 V1、HY-MT2-1.8B 与 Qwen3.5-2B,每模型 2,341 条。下表是自动裁判的 V1 获偏好数 : 对手获偏好数,并非准确率;平局、不确定和错误见论文全表。
| 测试组 | 样本数 | 对 HY-MT2 | 对 Qwen3.5 |
|---|---|---|---|
| Lecture | 304 | 69 : 27 | 109 : 16 |
| Context | 486 | 124 : 43 | 199 : 35 |
| Glossary | 452 | 104 : 46 | 157 : 42 |
| No context | 200 | 33 : 22 | 54 : 16 |
| WMT24 → 中文 | 300 | 47 : 92 | 123 : 41 |
| Multitarget(混合年份) | 599 | 68 : 314 | 232 : 108 |
V1 在部分中文业务组更受自动裁判偏好,HY-MT2 在多语言组更强。标准参考指标与裁判结果存在分歧;训练输入重合、重复开发评测与解码配置差异均在论文中分析。当前没有独立人工评测,也没有全面行业领先的结论。
演示版本: ab8091bf3fce317c8ef72b8a0749b557f34bccb1。线上适配器与论文 V8 epoch-2 适配器 SHA-256 一致,但两份合并导出的权重文件 SHA-256 不同,尚未验证张量或输出等价;表中结果属于论文归档导出。
作者
Han Li — hli227@alumni.jh.edu
Yangjie Luo — luo.engineer@mail.black-tom.com
论文 PDF · LaTeX 源码与聚合证据 · 完整版本说明
更新:2026-09-14。论文为作者初稿,尚未投稿或通过同行评审。