标签

「tokenizer」相关文章

汇总「tokenizer」相关的原创 AI 技术文章与大模型实践笔记，持续更新。

标签:#tokenizer

OpenAI开源GPT-2的子词标记化神器——tiktoken，一个超级快的（Byte Pair Encoder，BPE）字节对编码Python库

OpenAI在其官方GitHub上公开了一个最新的开源Python库：tiktoken，这个库主要是用力做字节对编码的。相比较HuggingFace的tokenizer，其速度提升了好几倍。

2022/12/16 21:11:164,766