01.AI自身の研究チームがarXivで公開した論文『Yi: Open Foundation Models by 01.AI』(arXiv:2403.04652)によると、Yiは『カスケード型の重複除去と品質フィルタリングのパイプラインを用いて構築した、英語と中国語からなる3.1兆トークンのコーパス』で事前学習されています。さらに『軽量な継続事前学習によってコンテキスト長を20万トークンまで拡張し、needle-in-a-haystack検索タスクで高い性能を示した』と述べられており、この拡張には5億トークン規模の長文データでの追加学習が用いられたとされています。モデル構成としては60億・340億パラメータのベースモデルに加え、指示チューニング済みのChatモデル、視覚言語モデル(Yi-VL)、6Bを32層から48層へ拡張した深層アップスケール版(Yi-9B)が提供されています。これは01.AI自身が公開した論文の記述に基づく情報である点に留意してください。