LLM DATA PREPARATION
大模型训练数据怎么准备?从清洗、标注到评测集版本
大模型项目需要的不只是更多数据,而是用途明确、来源可说明、结构可处理、质量可复核的数据版本。预训练、监督微调、偏好对齐、检索增强和效果评测对应不同的数据任务,不能用一套样本和指标覆盖全部阶段。
内容更新:2026-09-04先按模型任务拆分数据集,再分别确定来源、处理、标注与验收规则
高质量数据准备应同时管理原始数据、处理中间版本、训练集、验证集、测试集和评测记录,避免数据泄漏、重复污染以及不同版本混用。
DATA TASKS
不同训练和应用阶段,需要不同的数据结构
PRETRAINING
领域语料
侧重规模、覆盖、去重、清洗、语言质量和来源记录。SFT
监督微调样本
由输入、期望输出和任务说明组成,强调正确性、格式与难度分布。PREFERENCE
偏好数据
对候选回答进行比较、排序或评分,需要清晰量规和一致性复核。SAFETY
安全数据
覆盖拒答、边界、对抗和高风险问题,并保留审核依据。RAG
检索语料
处理文档结构、切分、元数据、权限、版本和引用定位。EVALUATION
评测数据
与训练数据隔离,覆盖典型任务、难例、边界和失败场景。WORKFLOW
六步建立可追溯的数据生产链
01任务定义目标、对象与边界
02来源核对授权、用途与期限
03清洗去重格式、噪声与重复
04标注构造规则、样例与审核
05切分隔离训练、验证与测试
06版本交付数据、报告与限制
QUALITY
质量要对应具体模型任务
CORRECTNESS
内容正确
答案、标签和引用符合任务事实与规则,高风险内容经人工复核。DIVERSITY
分布合理
覆盖主要场景、表达、难度和边界,避免某类样本过度集中。CONSISTENCY
规则一致
通过试标、校准、抽检和争议仲裁减少执行偏差。DEDUPLICATION
重复受控
识别文本、模板和语义近重复,评估其对训练和评测的影响。TRACEABILITY
来源可追溯
记录来源、处理步骤、标注者、审核、工具与版本。LEAKAGE
避免数据泄漏
训练数据与评测数据隔离,检查同源、相似和答案污染。EVALUATION VERSION
评测集要稳定,同时保留受控更新机制
评测集应标明任务范围、数据来源、难度结构、评分规则、基准答案、审核状态和版本号。模型、提示词、检索语料或业务规则发生变化时,记录受影响样本与回归结果;不要因追求分数而反复将评测答案泄露给训练过程。
单一平均分不足以说明效果:应同时观察主要任务、失败类别、风险场景和不同数据分布下的表现,并保留人工复核。
DATA GOVERNANCE
来源、权限和用途需要贯穿全部版本
公开可访问不等于可任意用于训练。项目应核对数据来源、授权依据、处理目的、敏感信息、访问范围、保存期限、衍生数据和到期处置。模型生成内容用于构造样本时,还需记录生成模型、提示、筛选规则和人工审核方式。
结论:大模型数据工程的核心是任务匹配与版本可追溯
数据规模只有在来源、结构、质量、隔离和评测规则清晰时才有意义。瑞铭安普可结合模型任务与现有数据,协助梳理数据准备、标注、质检和版本交付路径;具体数据可用性与指标需经样本验证确认。电话沟通:010-82170503。