书译
书译

如何翻译学术研究论文:保留公式、引文与排版

大多数工具会把双栏版式搅成一团乱码。了解如何翻译学术 PDF,同时保留公式、引文和栏结构。

BookTranslator

BookTranslator Team

18 min read

简短回答

要翻译学术研究论文,请使用能够保留阅读顺序、公式、引文、表格、图件和术语的 PDF 工作流。除非你准备手动修正阅读顺序,否则不要把双栏 PDF 中的文字直接复制出来。对于临床、法律、监管或出版级决策,在没有人工复核的情况下,不要仅依赖 AI 翻译。

最稳妥的流程是:

  1. 确认 PDF 中的文本可选中。
  2. 如果是扫描件,先执行 OCR。
  3. 使用版式感知型 PDF 翻译工具进行翻译。
  4. 对摘要、方法、结果和结论进行双语审校。
  5. 检查公式、引文、数字、表格和术语。
  6. 引用原始论文,而不是机器翻译后的输出。

对于版式复杂的研究类 PDF,请使用 PDF 翻译器。如果你的问题是一般性的 PDF 格式保留,请阅读如何在不丢失格式的情况下翻译 PDF。如果论文是扫描件,请先查看扫描版 PDF 翻译指南。如果要比较工具,请参见最佳 PDF 翻译工具

为什么学术论文难以翻译

学术 PDF 并不是简单的文本文件。它们结合了版式、符号表示、元数据和领域词汇。

元素翻译风险优质输出应保留的内容
双栏版式阅读顺序可能被打乱左右两栏保持逻辑顺序
公式符号可能损坏,甚至被“翻译”数学表达保持不变
引文标记可能被移动、翻译或重新编号引用格式和参考文献保持完整
表格单元格可能合并或错位行、列、表头和单位保持可用
图件图注可能与图像脱离图注被翻译,同时图件位置仍然清晰
术语同一个术语可能被翻译成多种说法关键术语保持一致
姓名和机构信息人名和机构名称可能被改动姓名、邮箱、ORCID ID、DOI 和其他标识符保持稳定

这就是为什么原始复制粘贴经常会失败。它可能会把被打乱的文本翻得很流畅,却依然是错误的。

第 1 步:识别 PDF 类型

在开始翻译之前,先回答一个问题:你能在 PDF 中选中文本吗?

PDF 类型识别方式推荐工作流
文本型 PDF你可以高亮单个词语直接使用版式感知型 PDF 工作流进行翻译
扫描版 PDF你只能把整页选中为一张图片先执行 OCR,再翻译
混合型 PDF有些页面可选中,有些页面是图片对扫描页执行 OCR,或使用能同时识别两者的工作流
导出的预印本 PDF文本可选中,但版式可能较粗糙先翻译,再检查栏结构、图件和参考文献

如果 PDF 是扫描件,翻译质量取决于 OCR 质量。低分辨率扫描、页面倾斜、手写内容、印章和页边批注,都可能损坏提取出来的文本。在判断翻译模型之前,请先参考扫描版 PDF 翻译指南

第 2 步:保护公式和符号表示

公式通常应该原样保留。周围的说明性文字应该翻译,但数学表达式本身不应被改写。

请检查:

  • 行内公式
  • 独立显示公式
  • 公式编号
  • 希腊字母符号
  • 矩阵和积分式
  • 化学公式
  • 单位和常数
  • 例如“Eq. (3)”或“Figure 2”之类的引用

需要警惕的失败示例:

  • alpha 被翻译成单词,而原本应保留为符号
  • 公式编号被删除
  • 负号被改动或丢失
  • 公式在换行处被错误拆分
  • 对公式的引用不再与论文对应

对于高风险的技术内容,请在翻译完成后让领域专家检查公式和关键论断。

第 3 步:保留引文和参考文献

引文是导航工具,不应被随意本地化。

引用元素推荐处理方式
文中引用,作者-年份格式保留作者姓名和年份
编号式引用保留方括号编号或上标编号
参考文献列表通常保留原始书目信息
DOI、URL、PMID、arXiv ID精确保留
期刊名称通常不要翻译,除非你的风格指南明确要求
“et al.”不要破坏作者归属关系

如果你在撰写自己的论文,应引用原始来源。如果你引用机器翻译内容,应根据你所在领域的规范,说明该翻译是机器辅助或机器生成的。

第 4 步:处理表格和图件

学术论文中的大量证据都承载在表格和图件中。它们需要与正文不同的审校流程。

表格检查清单:

  • 所有行和列是否都在?
  • 表头是否已翻译?
  • 单位是否仍与数值对应?
  • 小数点、逗号、区间和置信区间是否仍然正确?
  • 脚注是否仍靠近对应表格?

图件检查清单:

  • 图注是否已翻译?
  • 图像是否仍在正确位置?
  • 图中的坐标轴标签是否保持不变,或被有意处理?
  • 正文中的图件引用是否仍然正确?
  • A、B、C 这类多面板标签是否仍然可见?

不要假设图像内部的文字会自动翻译。如果图表标签嵌入在图中,可能需要单独的图像编辑或重绘工作流。

第 5 步:建立术语审校清单

对于学术翻译来说,一致性通常比文笔优美更重要。

在审校前,请列出:

  • 核心概念
  • 方法名称
  • 生物体名称
  • 化学名称
  • 疾病名称
  • 模型名称
  • 数据集名称
  • 缩写
  • 作者自定义术语

然后在译文中搜索这些术语。如果同一个源语言术语对应了多个目标语言译法,就决定保留哪一个,并统一修订其余用法。

这一点在以下领域尤为重要:

  • 医学
  • 法律
  • 化学
  • 机器学习
  • 工程学
  • 经济学
  • 哲学
  • 文学理论

第 6 步:翻译并审校论文

可以使用以下实用工作流:

  1. 将论文上传到 PDF 翻译器 或类似的版式感知型工作流。
  2. 选择正确的源语言和目标语言。
  3. 下载翻译后的 PDF。
  4. 将原文和译文并排打开。
  5. 审查摘要、引言、方法、结果和结论。
  6. 抽查每个表格和图注。
  7. 检查公式、数字、引文和参考文献。
  8. 如有需要,建立术语修订清单。
  9. 保存译文 PDF,并附上原始引文信息。

如果你需要翻译的是整本书、学位论文或篇幅很长的学术专著,而不是单篇论文,请使用图书翻译,并按章节套用同样的审校逻辑。

学术翻译 QA 清单

在依赖译文之前,请先使用这份清单:

部分检查内容
标题和摘要研究问题、方法、关键结果和范围
引言既有研究和引文含义
方法协议、变量、模型、数据集、仪器
结果数值、p 值、置信区间、表格、图件
讨论因果性论断、局限性和保留语气
结论最终结论是否与原文一致
参考文献姓名、年份、期刊名称、标识符
补充材料如有需要,相关独立文件是否已单独翻译并审校

不要跳过结论部分。一篇论文的正文可能大致可读,但最终结论仍然可能被误译。

对比:常见工作流

工作流优势弱点最适用场景
复制粘贴到 LLM 中适合快速处理一个段落会丢失版式和上下文;容易漏掉部分内容检查单个段落
浏览器/文档翻译方便可能破坏栏结构、表格和公式简单的单栏 PDF
版式感知型 PDF 翻译器能保留文档结构仍然需要技术性审校完整研究论文
人工学术译者置信度最高成本高、速度慢出版、法律、临床、受监管用途
AI + 专家复核混合流程平衡较好需要明确的复核流程文献综述、内部研究、会议准备

如果你想更全面地选择 PDF 工具,请参见最佳 PDF 翻译工具

使用场景

文献综述

AI 翻译非常适合筛选你无法直接阅读语言的论文。可以先翻译摘要、结论和相关章节。如果这篇论文后来成为你工作的核心文献,就应仔细审查完整译文,并引用原始论文。

系统综述

可以使用翻译来减少语言偏倚,但要记录你的流程。保留源 PDF、译文 PDF、翻译方法以及所有审稿人备注。如果纳入决定依赖某段译文,请在可能的情况下让双语审稿人进行核查。

会议准备

在会议开始前翻译其他演讲者的论文。重点审查问题陈述、方法、结果和局限性,这样你才能提出更有质量的问题。

学术协作

对于跨语言合作的研究团队,双语输出非常有用。团队成员可以在讨论译文的同时,在需要时核对原始术语。

教材与课程资料包

教材与学术论文有很多相同的问题:公式、图件、表格、术语,以及长篇内容的一致性。应按章节翻译,建立术语表,并让学科审稿人复核那些学生会被考核的章节。

已知失败模式

失败类型表现形式为什么重要
栏位合并左右两栏的段落交错在一起论证会变得难以阅读
公式损坏符号、正负号或公式编号发生变化技术含义可能出错
引文损坏引用标记移动或消失论断无法追溯
表格漂移表头与数值不再对应数据会产生误导
术语过度自信某个术语读起来流畅,但不符合该领域用法读者会误解方法
保留语气丢失“May”“suggests”或“not significant”被译得过强科学论断被夸大
图中未翻译文字图注已翻译,但嵌入图中的标签没有翻译读者可能错过图像中的证据
OCR 错误扫描文本在翻译前就已被误读翻译会忠实地把错误输入继续翻错

伦理与实际边界

AI 翻译适用于理解内容、文献综述、内部讨论和初步筛选。但当输出会影响出版、患者护理、法律主张、监管决策、工程安全或公共政策时,就必须更加谨慎。

实用原则:

  • 引用原始论文。
  • 除非你拥有相应权利,否则不要重新发布译文。
  • 如果你的使用场景有要求,在引用译文时要说明其为机器翻译。
  • 让有资质的人工审稿人核查关键论断。
  • 将源文件与译文一并保留,以便读者核对重要段落。

FAQ

AI 能准确翻译学术论文吗?

对于许多主流语言对来说,AI 翻译通常已经足以支持理解和文献综述,但准确性仍然取决于原文质量、术语、版式和审校流程。对于出版、临床、法律、监管或安全关键型工作,请使用人工或领域专家复核。

如何翻译双栏研究论文 PDF?

请使用版式感知型 PDF 翻译器,并检查输出的阅读顺序。双栏论文在把文本提取为单一线性流时经常出错。如果两栏段落交错在一起,请换用更好的 PDF 工作流重新处理。

公式会被保留吗?

它们应该被保留,而不是被翻译。翻译后,请抽查公式、公式编号、对公式的引用、希腊字母符号、单位和正负号。对于重要的技术用途,请让领域专家进行核验。

参考文献应该翻译吗?

通常不需要。作者姓名、期刊名称、年份、DOI 和各类标识符都应保持可追溯。引文周围的正文可以翻译,但引用标记和参考文献列表应保持可用。

如果我的学术 PDF 是扫描件怎么办?

请先执行 OCR,或使用能够处理扫描版 PDF 的工作流。翻译质量无法弥补 OCR 误读的文本。请先从如何翻译扫描版 PDF开始。

我可以引用机器翻译后的论文吗?

请引用原始论文。如果你引用了机器翻译的段落,请在适当情况下说明翻译方法;如果相关论断很重要,请对照原文核实引文。

翻译学术论文的最佳工具是什么?

最好的工具,是那个既能保留版式,又能让你进行审校的工具。对于学术 PDF 来说,这意味着栏结构、公式、表格、图注和引文都必须保留下来。你可以先从 PDF 翻译器 开始,再到最佳 PDF 翻译工具指南中比较其他选择。

相关文章