
GuoFeng-Webnovel是一个由腾讯AI实验室和阅文集团联合开发的多语言网络小说语料库,旨在推动文学机器翻译领域的研究和发展。该项目的主要目标是为研究人员提供高质量的文学翻译数据,帮助解决文学机器翻译面临的诸多挑战。
如上图所示,来自45个不同地区的研究机构和公司已经下载了GuoFeng-Webnovel数据集,这充分说明该项目和数据集已经引起了广泛的关注和兴趣。
文学机器翻译长期以来一直是机器翻译领域的一个难题。与普通文本相比,文学作品通常具有以下特点:
这些特点使得文学机器翻译面临着诸多困难,主要体现在以下几个方面:
GuoFeng-Webnovel项目的推出,正是为了应对这些挑战,推动文学机器翻译研究的发展。该项目的主要意义体现在:
GuoFeng-Webnovel语料库的主要特点包括:
数据集的具体统计信息如下表所示:
| 数据集 | 书籍数 | 章节数 | 句子数 | 备注 |
|---|---|---|---|---|
| 训练集 | 179 | 22,567 | 1,939,187 | 涵盖14个文学体裁 |
| 验证集1 | 22 | 22 | 755 | 与训练集相同书籍 |
| 测试集1 | 26 | 22 | 697 | 与训练集相同书籍 |
| 验证集2 | 10 | 10 | 853 | 不同于训练集的书籍 |
| 测试集2 | 12 | 12 | 917 | 不同于训练集的书籍 |
| 测试输入 | 12 | 239 | 16,742 | 不同于训练集的书籍,超长文档 |
GuoFeng-Webnovel数据集采用了结构化的格式,以保留文档级信息。以英文训练集"train.en"为例,数据格式如下:
<BOOK id="100-jdxx"> <CHAPTER id="jdxx_0001"> Chapter 1 Make Your Choice, Youth "Implode reality, pulverize thy spirit. By banishing this world, comply with the blood pact, I will summon forth thee, O' young Demon King!" At a park during sunset, a childlike, handsome youth placed his left hand on his chest, while his right hand was stretched out with his fingers wide open, as though he was about to release something amazing from his palm. He looked serious and solemn. ... ... </CHAPTER> <CHAPTER id="jdxx_0002"> .... </CHAPTER> </BOOK>
这种格式设计使得研究人员可以方便地获取书籍、章节等文档级信息,有助于开展篇章级翻译研究。
为了进一步支持研究人员的工作,GuoFeng-Webnovel项目还提供了两种针对文学领域的预训练模型:
领域内RoBERTa (base版本):
领域内mBART (CC25版本):
这些预训练模型可以帮助研究人员快速开始相关实验,提高模型的初始性能。
GuoFeng-Webnovel项目采用了多维度的评估方法,以全面衡量文学机器翻译的质量:
自动评估:
人工评估:
这种多维度的评估方法有助于更全面、更准确地衡量文学机器翻译的质量。

上图展示了一个文学机器翻译的示例,充分说明了文学翻译的复杂性和挑战性。
自GuoFeng-Webnovel项目推出以来,已经引起了学术界和工业界的广泛关注。该项目不仅为文学机器翻译研究提供了宝贵的资源,也为自然语言处理领域的其他任务,如长文本理解、文本生成等提供了有价值的数据支持。
未来,GuoFeng-Webnovel项目计划在以下几个方面继续发展:
总的来说,GuoFeng-Webnovel项目为文学机器翻译研究开辟了新的道路,为解决这一领域的长期挑战提供了重要支持。随着项目的不断发展和完善,相信它将在推动自然语言处理技术进步、促进文化交流等方面发挥越来越重要的作用。