如何阅读青空文库图书:版本、振假名与文本文件
在浏览器中打开青空文库图书,选择正确的日文版本,修复 Shift-JIS 文本乱码,并在不删除有用注释的情况下理解振假名。

要阅读青空文库的图书,请打开其作品卡片并选择 いますぐXHTML版で読む——即立即阅读 XHTML 版本的链接。如果您想在浏览器中阅读,请从这里开始。只有在需要本地文件或支持青空文本的阅读器应用时,才下载文本 ZIP。官方的 下载指南 对这两种格式进行了区分。
更有用的问题通常是 我正在看的是哪个日文文本? 经典作品的现代假名版本并不一定等于作者初版印刷时的版本。乱码下载可能需要正确的编码,而不是 OCR 识别。而且青空文本文件中的括号可能包含阅读辅助工具,而不是不需要的文本。
从作品卡片开始,而不是零散的下载
作品卡片,即 図書カード,连接了书名、作者、源版本和可用文件。例如,夏目漱石的 《心》 Kokoro 的作品卡片既有直接的 XHTML 阅读链接,也有位于下方的下载表格。
请先打开 XHTML 链接。调整浏览器的缩放比例,直到正文和小号的阅读辅助文字都感觉舒适。先读几段,然后再决定是否需要更换应用。如果您在这里能舒适地阅读,就可以把转换留到以后再说。
请同时书签收藏作品卡片和阅读页面。青空的 FAQ 解释说,即使链接的文件被替换,作品卡片的地址仍然是一个参考点。对于您的阅读位置,还要记下章节标题和您停止阅读的段落中的一小短语;仅靠浏览器书签无法可靠地描述长页面中的具体位置。
如果书名或语言不对,请在解决显示问题之前返回源选择页面。我们关于 寻找合适的公有领域电子书版本 的指南涵盖了这一更广泛的决定。
在“修复”日语之前先检查版本
寻找 文字遣い種別,这是卡片上的字符与假名分类。请分两部分阅读该标签: 新字 / 旧字 涉及新旧字符形式; 新仮名 / 旧仮名 涉及现代或历史假名拼写。这些是独立的选项,而不是从“坏文本”到“好文本”的单一标尺。青空文库的 正字法指南 明确允许在保留历史假名的同时使字符现代化。
对于普通阅读,如果作品提供且你熟悉现代日语拼写,我建议从 新字新仮名 开始。但该标签并不承诺简化词汇或重写故事。对于文学研究,请选择你的问题研究所需的源版本;仅凭旧字符标签并不能确定你拥有初版影印本。
三部夏目漱石的作品卡片说明了版本详情的重要性。我们在2026年9月10日核实了这些记录;这三部作品均将其文本分类为新字新仮名。
| 作品与官方卡片 | 指定为底本(即源文本)的印刷版本 | 源版本的首次发行日期 |
|---|---|---|
| 心 — こころ,第 773 号 | 心,集英社文库 | 1991年2月25日 |
| 少爷 — 坊っちゃん,第 752 号 | 筑摩日本文学全集:夏目漱石,筑摩书房 | 1992年1月20日 |
| 我是猫 — 吾輩は猫である,第 789 号 | 夏目漱石全集 1,筑摩文库 | 1987年9月29日 |
这些日期属于所列出的源版本,而不是故事首次发表的时间。 《心》,例如,于1914年在 《朝日新闻》 上连载。其卡片单独标明了用于输入的1995年第十次印刷版本。这比“1914年原版”更能精确描述数字文本的来源。
如果是为了消遣阅读,记录一次源版本就足够了。如果您要将引文与纸质副本进行核对,请在假设字词差异是错误之前,先检查 入力に使用 字段——即用于输入的印刷版本。
如果您下载了TXT文件,请使用列出的编码将其打开
在下载表格中, テキストファイル(ルビあり) 表示带有注音假名的文本文件。 圧縮 表示压缩格式; 文字集合/符号化方式 表示字符集和编码。对于上述三个文件,卡片指定的是 JIS X 0208 / ShiftJIS。这些字段(而不是您操作系统的默认设置)会告诉您如何解读该文件。请参阅 下载列的官方说明.
请按照以下顺序操作:
- 下载作品卡片中链接的 ZIP 文件并将其解压。请保持原始 ZIP 文件不变。
- 在允许选择编码的编辑器或阅读器中打开解压后的
.txt。对于这三个文件,请选择 Shift-JIS。 - 将一小段文字与官方 XHTML 进行对比。如果结果出现乱码,请在保存任何更改之前,使用正确的编码重新打开未修改的文件。
- 如果其他应用程序需要 UTF-8,请仅在源文件正确显示后,再单独制作一份 UTF-8 副本。请妥善保存其源卡片和版本详细信息。
我们在2026年9月10日重新获取了所有三个官方 ZIP 文件。每个文件都通过了 ZIP 完整性检查,并且使用严格的 Shift-JIS 成功解码了 TXT。严格的 UTF-8 解码对这三个文件均告失败。这是编码不匹配,并不是这些下载需要 OCR 或小说受损的证据。
里面的文件是 kokoro.txt, bocchan.txt,以及 wagahaiwa_nekodearu.txt。我们的 三部作品版本与编码记录 (CSV) 包含来源链接、日期、文件名和 ZIP 校验和。它记录的是文件检查结果——而非成功的 EPUB 转换或在您的设备上进行的测试。该下载内容中不包含任何源小说。
一个区分可以省去不必要的麻烦:如果日语字符显示连贯但看起来在历史上很陌生,请检查版本标签。如果文本显示为无意义的乱码,请检查编码。面对这两种情况,盲目更换字体或重新转录整本书都不应该是您的首选应对方式。
阅读注音与注释,而不会丢失有用的文本
注音(Ruby)是附加在单词或短语上的小字,通常用于显示其读音。在 Aozora TXT 中,它出现在 《 》内部。一个全角的 | 可以标记接收该注音的文本起始位置。Aozora 在其 注音符号参考.
中记录了这些约定。以下是专为本指南编写的两句话,并非引自 Aozora 小说:
私は図書館《としょかん》で本を借りた。
|青い屋根《あおいやね》の家が見える。
在第一句中, としょかん 提供了 図書館的读音:“我在图书馆借了一本书。”它不是名词后面需要额外阅读的词。在第二句中,竖线开启了混合字符短语 青い屋根,“蓝色的屋顶”,其读音随后在括号中给出。
其他括号承担着不同的工作。第三个原创示例包含一个强调指令:
まだ間に合う[#「まだ間に合う」に傍点]。
这句话的意思是“时间还来得及。”括号部分要求对前面的短语加强调点,它不是叙述文字。该语法来自 Aozora 的 强调符号参考。您可以下载所有三个 带有解释的原创练习句子 (UTF-8 TXT).
不要试图通过删除整本书中匹配某种模式的所有内容来解决令人分心的括号问题。某些注释描述了文件中标准字符集之外的字符;移除注释可能会丢弃识别该字符所需的信息。Aozora 的 外部字符参考 说明了为什么这些并非全部都是可随意丢弃的排版指令。
为了阅读,当原始符号变得枯燥时,请返回官方的 XHTML。它为您区分文学文本与其在 TXT 中的表示形式提供了一个有用的参考。
在转换整本书之前,先选择一个舒适的阅读设置
如果浏览器阅读效果很好,你的下一个改进可能只是更大的字号以及从正确段落继续阅读的方法。如果频繁的查词打扰了你,请先在一段简短的文本上尝试你习惯的词典工作流。这两个任务都不需要转换整部小说。
对于离线阅读器或 EPUB 转换,请提出比“它能打开 TXT 吗?”更具体的问题。你需要了解 这个文件的 编码、注音假名(ruby)、注释和章节分隔会发生什么变化。纯文本导入并不能证明某个应用程序理解青空文库(Aozora)的标记。将 .txt 重命名为 .epub 并不能创造一本 EPUB。
在确定该设置之前,请对比:
- 包含官方 XHTML 的开头段落,以便尽早发现无法读取的字符。
- 包含注音假名(ruby)以及(如果存在的话)着重号或不常见字符注释的段落。
- 中间部分和最后一部分,以便检查远离首页时是否存在顺序混乱或文本缺失的问题。
- 你实际的停止和重新打开阅读的工作流,以便你可以不用重新搜索整部小说就能继续阅读。
使用 空白阅读工作表 (CSV) 来记录这些观察结果。将未经测试的项目标记为 not_checked;打开文件并不等于通过了全书校对。随附的 下载说明和来源归属 解释了我们的三文件检查能够以及不能确定什么。
我们尚未将这三个下载文件转换为 EPUB,也没有在特定的阅读器中对其进行测试。请根据工具当前的支援情况和你自己的简短对比来选择工具,而不是轻信“每个青空文库文件表现都一样”的说法。
当剩下的障碍是语言时
一旦日语显示正常,请确定你实际上需要多少语言支援。对于偶尔遇到的生词,一本词典可能就足够了。与准备一项新翻译相比,一本合适的现成翻译版本可能是一个更好的阅读选择。但这并不意味着源文件需要修复。
在上传、改编或分享一部作品之前,请查看其具体的版权信息以及你的预期用途。青空文库的 文件使用政策 区分了版权已过期的作品和仍受保护的作品,其中包括译者保留版权的翻译作品。该网站上有资源并不代表所有作品在全球范围内都属于公有领域。
如果您确实需要一份完整的译本,请 先做好翻译准备 :保留源版本、确定格式,并决定如何处理阅读辅助工具和注释。对于允许使用的可用 EPUB, BookTranslator 的 EPUB 翻译器 是一个翻译选项。这与下载青空文库 ZIP 是独立的步骤;本指南不涉及自动处理其编码或注释语法。
如果您想在对照另一种语言的同时继续检查日语, 双语 EPUB 指南 涵盖了排版和审阅决策。否则,请返回您选择的 XHTML 页面继续阅读。一份准确、舒适的原文本身就已经是一个成功的成果。





