Falco-40B是400亿参数的因果解码器模型,它在RefiedWeb的1000Btoke上进行训练,并使用精选数据集增强。它在Huggigface的OpeLLM排行榜上排首位,其性能优于LLaMA、MPT、RedPajama和StableLM等。
Falco-40B使用自定义工具构建,包含一个独特的数据管道,该管道从公开网络中提取训练数据。
Falco从公网上抓取内容构建好Falco的初始预训练数据集后,再使用CommoCrawl转储,进行大量过滤(包括删除机器生成的文本和成人内容),并消除重复数据,最终得到一个由近5万亿个toke组成的庞大预训练数据集。
Falco一共包含4个版本:
Falco-40B:在1万亿toke上进行训练,并使用精选语料库进行了增强;主要接受英语、德语、西班牙语、法语的训练,不会中文。Falco-40B-Istruct:在Baize上进行了微调,使用FlashAttetio和多查询对推理架构进行了优化,是一个即用型聊天模型。Falco-7B:参数70亿,在1.5万亿toke上进行了训练,作为一个原始的预训练模型,还需要用户针对大多数用例进一步微调。Falco-RW-7B:参数70亿,在3500亿toke上进行训练,该模型旨在用作“研究神器”,单独研究各种在网络数据进行训练的影响。






评论