跳到正文
原文
arXiv 自然语言处理· Thomas Serval·· 1 天前AI 评分45

LLM 分词器的隐形语言税:法语与区域语言 token 溢价及优化原型

The Invisible Language Tax: Token Premiums of French and Regional Languages in 2026 LLM Tokenizers, and a French-Optimized Prototype

AI 导读

研究评测了 OpenAI o200k、Llama 3、Qwen3、DeepSeek V3/V4、Gemma 3、Tekken 及 Claude 等 7 款大模型分词器,发现法语比英语多消耗 31% 至 58% 的 token,法国区域语言更是达到英语的 1.6 至 3.3 倍。

来源:arXiv 自然语言处理 · arxiv.org