
data_io
sapientinc
Data pipeline for HRM-Text pretraining
AI 简介
这是一个面向HRM-Text大语言模型预训练的数据流水线工具,专注于构建指令微调风格的问答对数据集。核心功能包括:标准化清洗(统一为instruction-response格式)、基于Rust的高性能BPE分词器训练与应用、以及支持配置化策略的分层抽样(stratified sampling)以生成平衡的tokenized训练数据。技术特点涵盖内存高效清洗(需512GiB RAM)、Parquet/JSONL多格式输出、以及可复现的端到端流程。适用于需要高质量指令数据预训练或微调垂直领域大语言模型的研究与工程场景。
Python
Apache License 2.066
Stars
15
Forks
1
Watchers
1
Issues
Star 增长
今日0
近 7 天0
近 30 天0
综合评分43.61
默认分支main