Ai2 称 Marin 最新 hero run 包含约 1.8 万亿个 Dolma 3.5 token
Ai2 称,Marin 最新 hero run 包含其 Dolma 3.5 语料库中约 1.8 万亿个 token,且 Marin 的数据配比工作借鉴了 Ai2 的 Olmix 配方和 Organize the Web 数据整理方法。Will Held 称,Marin 的 535B 训练基于 152 个许可允许用于训练的数据集,共计 25 万亿个 token。
Ai2 称,Marin 最新 hero run 包含其 Dolma 3.5 语料库中约 1.8 万亿个 token,且 Marin 的数据配比工作借鉴了 Ai2 的 Olmix 配方和 Organize the Web 数据整理方法。Will Held 称,Marin 的 535B 训练基于 152 个许可允许用于训练的数据集,共计 25 万亿个 token。