MFTCoder 数据集推荐:Evol-instruction-66k 与 CodeExercise-Python-27k 最佳使用方法

发布时间:2026/7/28 6:44:41
MFTCoder 数据集推荐:Evol-instruction-66k 与 CodeExercise-Python-27k 最佳使用方法 MFTCoder 数据集推荐Evol-instruction-66k 与 CodeExercise-Python-27k 最佳使用方法【免费下载链接】MFTCoderHigh Accuracy and efficiency multi-task fine-tuning framework for Code LLMs. This work has been accepted by KDD 2024.项目地址: https://gitcode.com/gh_mirrors/mf/MFTCoderMFTCoder 是一个高效的多任务微调框架专为代码大语言模型设计。本文将详细介绍如何使用其推荐的两个高质量数据集——Evol-instruction-66k 和 CodeExercise-Python-27k帮助你快速提升模型性能。为什么选择这两个数据集MFTCoder 框架在设计时特别优化了对这两个数据集的支持。Evol-instruction-66k 基于开源的 open-evol-instruction-80k 过滤低质量、重复和与 HumanEval 相似的数据后得到包含丰富的代码指令微调数据而 CodeExercise-Python-27k 则是高质量的 Python 练习题数据集非常适合模型学习代码编写和问题解决能力。MFTCoder 多任务训练框架支持多种数据集和训练方式数据集准备步骤1. 获取数据集你可以从 Hugging Face 数据集库获取这两个数据集Evol-instruction-66kCodeExercise-Python-27k2. 数据集预处理MFTCoder 提供了专门的预处理工具位于mftcoder_accelerate/src/data/preprocess_data.py。该工具会将原始数据转换为模型可接受的格式。3. 配置数据路径在训练配置文件中设置数据路径例如在mftcoder_accelerate/src/configs/lora_train_config.json中添加{ data_paths: Evol-instruction-66k,CodeExercise-Python-27k, data_split: 90,5,5 }多任务训练实现MFTCoder 的多任务训练功能通过mftcoder_accelerate/src/data/multi_task_dataset.py实现。该模块支持同时加载多个数据集并根据配置自动分配权重。MFTCoder 支持多模型和多任务训练可同时处理多个数据集关键代码解析load_dataset_from_jsonl函数是加载多任务数据集的核心def load_dataset_from_jsonl(args, shard_dataFalse, world_size1, global_rank0, local_rank0): # tokenization编码器 encoder UniformEncoder(args, args.tokenize_mode) encoder.initializer() data_prefixes list(args.data_paths[1:-1].split(,)) # ... 处理多个数据集 # 创建混合数据集 blending_train_dataset GPT2BlendableDataset( all_train_datasets, train_sample_weights, global_train_num, local_train_num ) return blending_train_dataset, blending_valid_dataset设置数据集权重MFTCoder 支持动态调整不同数据集的权重以平衡训练效果# 计算数据集权重 train_loss_weights ds_fn(all_train_datasets_length) # 更新数据集权重 for i in range(len(all_train_datasets)): all_train_datasets[i].update_ds_weight(train_loss_weights[i] / factor)训练命令示例使用以下命令启动多任务训练同时使用 Evol-instruction-66k 和 CodeExercise-Python-27k 数据集git clone https://gitcode.com/gh_mirrors/mf/MFTCoder cd MFTCoder bash init_env.sh python -m mftcoder_accelerate.src.pefts.mft_accelerate \ --config_file mftcoder_accelerate/src/configs/lora_train_config.json \ --data_paths Evol-instruction-66k,CodeExercise-Python-27k最佳实践建议数据混合比例建议 Evol-instruction-66k 和 CodeExercise-Python-27k 的比例为 7:3可根据具体任务需求调整。训练超参数对于这两个数据集建议使用学习率 2e-5batch size 16训练 3-5 个 epoch。评估指标除了常规的困惑度Perplexity建议使用代码生成任务的准确率和 F1 分数作为评估指标。模型选择推荐使用 CodeLlama 或 StarCoder 作为基础模型这两个模型在代码任务上表现优异。通过合理使用 Evol-instruction-66k 和 CodeExercise-Python-27k 数据集结合 MFTCoder 的多任务训练能力你可以显著提升代码大语言模型的性能。开始你的模型微调之旅吧【免费下载链接】MFTCoderHigh Accuracy and efficiency multi-task fine-tuning framework for Code LLMs. This work has been accepted by KDD 2024.项目地址: https://gitcode.com/gh_mirrors/mf/MFTCoder创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考