DataFlow 3分钟上手:搭出你的第一条数据处理管道

发布时间:2026/8/24 8:54:27
DataFlow 3分钟上手:搭出你的第一条数据处理管道 DataFlow 3分钟上手搭出你的第一条数据处理管道【免费下载链接】DataFlowEasy Data Preparation with latest LLMs-based Operators and Pipelines.项目地址: https://gitcode.com/gh_mirrors/da/DataFlow数据很多、质量参差从哪下手你手头可能有一堆 PDF、爬来的文本和问答对格式不一、质量参差逐行手工清洗又慢又不稳。DataFlow 是一个 LLM 数据处理管道工具把数据生成、清洗、评估、过滤封装成可复用的 pipeline直接把原始素材变成预训练、SFT、RL 能用的训练数据。它还能接你自己的大模型 API或者跑本地开源模型。如果你曾被数据不够、数据不净、数据不均衡卡住过值得花 3 分钟认识一下它。 一句话定位DataFlow 能帮你做什么DataFlow 是一个开源的 LLM 数据准备与训练系统核心思路一句话把所有数据操作拆成算子operator再串成管道pipeline。像流水线一样每个工位干一道工序工位还能随时替换。每个算子吃进 JSON / JSONL / CSV吐出高质量结果可自由组合。100 算子即插即用文本、数学、代码预置管道WebUI 可视化搭管道API 与本地 GPU 都支持 快速上手安装并打开 WebUIpip install open-dataflow dataflow webui运行后浏览器会自动打开可视化界面你可以拖拽算子节点连成管道点运行就能执行。安装支持 Python 3.10–3.12Windows、Linux、macOS 都验证过。想用本地 GPU 跑模型把安装命令换成pip install open-dataflow[vllm]即可会顺带装好 vLLM。 核心能力拆解DataFlow 能干什么数据生成把已有内容变成更多训练样本。比如你只有几条种子问题它调用大模型扩写出成批的问答对和指令数据不用手写。数据清洗去重、去敏感信息、过滤低质内容。比如你拿到一批爬虫脏文本接上几个 filter 算子就能输出干净的预训练语料。数据评估按质量、难度等维度给数据打分。比如想对比两种清洗策略跑一遍同样的评估算子看分差谁好谁差一目了然。 实战小例子给问题文件补一列答案最小闭环是输入一个问题文件输出自动多一列答案。假设 input.json 里有 problem 列跑完每条数据会新增 solution 列from dataflow.operators.core_text import PromptedGenerator from dataflow.utils.storage import FileStorage from dataflow.serving import APILLMServing_request gen PromptedGenerator(llm_servingllm, system_promptPlease solve this math problem.) gen.run(storage, input_keyproblem, output_keysolution)就这么回事输入 → 算子 → 输出。想在后面加清洗再串一个算子就行结果文件自动落到 cache 目录拿去就能训。 部署选项Docker 快速部署docker pull molyheci/dataflow:cu124 docker run --gpus all -it molyheci/dataflow:cu124镜像内置 CUDA 12.4 和 vLLM拉下来开箱即用。也可以按仓库里的 Dockerfile 自己构建定制镜像。 进阶与资源文档去哪找中文 README安装、快速上手、常见问题都在这里示例管道目录文本、数学、Text2SQL 等预置管道脚本照着改最省事遇到问题可以直接去项目提 issue社区响应很快。【免费下载链接】DataFlowEasy Data Preparation with latest LLMs-based Operators and Pipelines.项目地址: https://gitcode.com/gh_mirrors/da/DataFlow创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考