arXiv 自然语言处理· A. Bochkov·· 7 小时前AI 评分34
大语言模型需要可训练的输入嵌入表吗?1.7B 规模下的固定最小 token 编码
Do Language Models Need a Trainable Input Embedding Table? Fixed Minimal Token Codes at 1.7B-Class Scale
AI 导读
一项针对 1.711B 参数大语言模型的研究表明,模型无需可训练的输入嵌入表即可获得实质性能力。在 100 billion prediction tokens 预算下,规范 16-bit token-ID 编码减少了 100.7 million 可训练参数,在 HellaSwag 和 PIQA 取得 52.40% 与 70.51% 准确率。
来源:arXiv 自然语言处理 · arxiv.org