跳到正文
原文
arXiv 自然语言处理· Szymon Kocur·· 4 小时前AI 评分29

Wieszcz-XIX:包含 31 亿词的 1918 年前波兰语语料库及从零训练的时间受限语言模型

Wieszcz-XIX: A 3.1-Billion-Word Corpus of Pre-1918 Polish and Temporally Bounded Language Models Trained From Scratch

AI 导读

研究人员发布了 Wieszcz-XIX 语料库,涵盖 1800 至 1918 年波兰语出版物共 6.75B tokens(约 31 亿词、294,369 篇文档),并基于该数据从零训练了 47M 至 349M 参数的 decoder-only 语言模型。

来源:arXiv 自然语言处理 · arxiv.org