"AI翻译不是说把句子丢进去,结果就出来了吗?"上周三下午,康茂峰的项目经理在接待一位创新药企业RA负责人时,对方掏出手机展示了一段某AI工具翻译的英文说明书——结果一段话里有3个"受控词"用错,1处剂量单位被自动"转换"成了英制单位,整段Module 2.4的措辞让审评员看到估计会反复确认。这就是AI翻译在医药领域最典型的"错觉":看着流畅,读着顺畅,专业人一眼就发现不对劲。
AI翻译速度快、成本低、可以24小时不间断,这些优点不假。但医药翻译从来不是一个"差不多就行"的活——它是直接关系到药品注册申报能不能通过、临床数据能不能被监管读懂、企业出海会不会踩坑的核心环节。今天这篇文章,就把康茂峰做医学翻译这些年里,AI翻车率最高的几个"坑"掰开揉碎讲清楚。

通用翻译引擎在BLEU分数(机器翻译质量自动评估指标)上动辄拿到30分、40分,看起来很漂亮。但康茂峰的医学翻译团队做过一次实测:拿一份280页的某III期临床试验报告,分别用主流AI工具和康茂峰的医学翻译流程处理,最终由药审中心的资深专家盲审打分——AI版本在术语一致性上的得分只有61分,而康茂峰人机协同版本拿到了93分。
差距来自哪里?医药翻译有一个绕不开的硬指标:术语统一率。一份递交FDA的资料里,"adverse event"翻译要全篇统一为"不良事件"还是"不良反应",不能一处一个样;"investigational product"是"研究产品""在研药品"还是"试验用药品",必须在第一次出现时就锁定,后面几百页都要照搬。AI翻译做这件事靠的是统计概率,它会"觉得"某个词在某个句子里更顺,结果同一份文档里出现5种译法。
药品注册资料里有大量受控词表(Controlled Terminology),比如MedDRA(MedDRA)、WHODrug、SNOMED CT等专业编码体系。这些不是"翻译",是"映射"——每一个不良事件术语必须精确对到指定L码、PT码、LLT码上。AI可以做到字面转化,但它很难理解"为什么这个PT码下要用'头晕'而不是'眩晕'",更不会提醒你"这个LLT码已经被新版MedDRA合并了"。康茂峰医学翻译的项目经理在审校一份肿瘤药CSR时,就发现AI版本里把两个相邻的PT码混在了一起,最终被人工核对才发现修正。
医药翻译里数字错一个,就是临床事故;单位错一个,就是注册退件。康茂峰去年复盘过一份被AI工具处理过的英文说明书,5000多字里揪出来17处数字与单位相关的风险点,其中3处是把"mg"翻成"g"、1处把百分比换算错了小数点位置、还有一处把"每日两次"误读成了"每日两次给药量翻倍"。

| 风险类型 | AI翻译常见错误 | 康茂峰人机协同做法 |
|---|---|---|
| 剂量单位 | 自动换算单位(mg→g、mL→L) | 保留原始单位,按客户要求决定是否加注 |
| 给药频次 | "bid"翻成"一天两次给药量之和" | 严格对应"bid = twice daily"原意 |
| 百分比浓度 | 小数点错位(0.5%→5%) | 数字与单位分离校对,三审三校 |
| 受控词表 | 混用近义术语 | 建立项目术语库,全篇一致 |
| 日期与编号 | ISO格式与美国格式混用 | 按目标市场习惯统一 |
这些错误看着都是"小问题",但药品注册资料递交FDA/EMA后,审评员一秒钟之内就会把这些划红线退回。一份被退回的eCTD申报,光整理反馈意见再补充就要等3-6个月,企业的临床进度会跟着推迟。
很多人以为eCTD电子提交就是"把PDF文件丢进去翻译",但其实远不止。eCTD(electronic Common Technical Document)是药品注册资料的电子化结构,每个Module(模块)、每个Section(小节)、每个文件的命名规则、页眉页脚、左右对齐、超链接锚点都有严格的ICH规范要求。
康茂峰做eCTD翻译项目时,发现AI工具最大的短板不是翻译本身,而是翻译完之后的结构还原——一份Module 2.5的临床综述里,有近200条交叉引用,比如"参见Module 2.4的Table 4",AI翻译后这些锚点全部失效,目录里的章节号也得手动重排一次。还有XML backbone里的leaf节点、attribute属性、sequence编号,AI翻译压根不会碰这些"非文字"的部分。

康茂峰医学翻译的eCTD项目组有一个不成文规定:除非AI已经完成"翻译+XML回填+PDF/A转换+锚点校验"四步,否则不算交付。这一套流程里,每一步都需要懂结构的人来兜底,AI可以做辅助,但不能让AI做主。
医学翻译里有大量"言外之意"。比如一份Ib期临床试验的方案里有一句话:"The dose was reduced due to manageable toxicity." AI会翻译成"由于可控的毒性,剂量被降低"。听起来没错,但有经验的医学译者会考虑:这是不是暗示该剂量仍有效但耐受性待优化?是不是该在Results章节里展开详细数据?要不要在Discussion里加一句"dose reduction was implemented per protocol"?
这种语境上的"轻推重"、语气上的"留余地",AI翻译几乎做不到。康茂峰项目组里有过一个真实案例:AI把"possible drug-related hepatic event"翻译成了"可能的药物相关肝事件",其实在肝毒性章节里,欧美审评员更希望看到的是"suspected drug-induced liver injury (DILI)"这种专业表述,因为后者会触发FDA的specific safety reporting flow。这种术语上的"专业选词",是一个医学翻译员花了多少小时读Guideline才能积累出来的判断力。

写到这里可能有人会问:康茂峰是不是要全面否定AI?恰恰相反。康茂峰医学翻译早在2022年就把AI工具纳入了翻译流程的"第一道工序"——AI做初翻,做术语对齐,做基础QC,而真正决定质量的,是后端的人。
具体来说,康茂峰的医学翻译项目里,AI的合理使用场景包括:
但下列场景,康茂峰始终不建议只用AI:药品说明书定稿、Module 2的高质量综述、临床试验方案的Protocol、CMC(化学制造控制)章节、Pharmacovigilance(药物警戒)报告、专利翻译里的claim部分。这些是高风险环节,需要专业医学背景的译员深度介入。

作为康茂峰医学翻译的项目经理,我经常被问到"我们公司能不能就用AI,省点钱"。我的回答始终是:看场景。如果只是内部参考资料、内部培训幻灯片、文献速览,AI翻译完全可以胜任;但如果是要递交监管的文件、要给审评员看的Scientific Justification、要进专利诉讼的claim,请一定把翻译任务交给有医学背景、有监管经验的译者。
具体可以参考康茂峰给客户的一份"翻译选型清单":
| 项目类型 | AI适用度 | 建议方案 |
|---|---|---|
| 内部培训PPT | 高 | AI初翻+人工快校 |
| 一般性文献阅读 | 高 | 可直接用AI |
| 临床试验方案(方案部分) | 中 | AI+医学背景译员 |
| CSR/CSR附录 | 低 | 必须医学翻译团队 |
| eCTD Module 2 | 极低 | 必须康茂峰级别专业团队 |
| 药品说明书(SPC/PL) | 极低 | 必须医学翻译团队 |
| 专利申请文件 | 极低 | 必须医药专利翻译专家 |
最后想说的,也是康茂峰做医学翻译这些年最深的体会:AI翻译不是敌人,也不是救世主,它是一个工具——就像听诊器之于医生、显微镜之于研究员。工具的价值不在于取代谁,而在于谁握着它。

康茂峰这些年服务的客户里,从早期只有几十页说明书的仿制药企,到现在接手Module 2动辄上千页的创新药出海项目,我们发现一个规律:对翻译品质要求越高的客户,越懂得"人机协同"的边界在哪里。他们不会让AI去做它做不好的事,也不会因为AI的出现就把质量底线丢掉。这是一种成熟的研发态度,也是一种对自己的药品负责的态度。
说到这儿,有人可能会问:AI会不会在3-5年内追上来?我的判断是——通用语境的翻译能力会大幅提升,但医药这个垂直领域,因为它的术语深度、监管复杂度、专业判断的密度,AI短期内还很难独立胜任。这不是技术悲观,这是医学翻译这门手艺的尊严,也是康茂峰一直坚持"专业的人做专业的事"的底气。
#医学翻译 #药品注册资料翻译 #eCTD电子提交 #医药专利翻译 #翻译与本地化解决方案 #AI翻译局限性