当前位置: 首页 > news >正文

dingo 数据质量评估:给 LLM 训练数据做体检

dingo 数据质量评估:给 LLM 训练数据做体检

【免费下载链接】dingoDingo: A Comprehensive AI Data, Model and Application Quality Evaluation Tool项目地址: https://gitcode.com/gh_mirrors/dingo5/dingo

语料里混着重复文档、乱码、身份证号,模型效果就被这些脏数据悄悄拖垮;人工抽检几万条文本,既慢又不稳定。dingo 是一款面向文本与多媒体数据集的数据质量评估工具,把规则检测与 LLM 评估组合成自动化流水线,覆盖预训练、微调和评估三类数据。

它能做什么

  • 文本、图像、音频都能检:图片侧还覆盖文图相关性、重复图、标注框重叠等检查
  • 预训练语料、SFT 微调数据、RAG 评估数据,走同一套配置框架
  • CLI 与 SDK 双入口:命令行跑批量任务,SDK 嵌进自有数据平台
  • 数据源支持本地文件、Hugging Face、SQL、S3,流式读取,大表不用先落地

它怎么工作

协作关系可以拆成三步:先用输入参数声明数据从哪来、要跑哪些评估器;然后执行器(Executor)按本地或 Spark 两种模式逐条读取数据源;最后每条数据分发给插件化的评估器——Rules、LLM-as-a-judge、VLM-as-a-judge、Agent 四类并行处理,结果汇成质量问题报告。

插件机制的价值在扩展:新增一个检测项不用改主流程,按评估器接口实现后注册即可;内置的 30+ 规则和 LLM 提示词也能按业务需要增删。

七个质量维度逐个看

  • 完整性:正文是否截断缺失,如未正常结尾的文本被RuleColonEnd拦下
  • 有效性:乱码与格式残留,如反爬乱字命中RuleAbnormalChar
  • 流畅性:语法与阅读节奏,如连续字符粘连命中RuleWordStuck
  • 相关性:开头混入无关来源信息,如RuleHeadWord系列按语言逐一过滤
  • 安全性:敏感信息泄漏,如身份证号出现在语料里会被RuleIDCard自动拦下
  • 相似性:重复内容,如整段复制的文档命中RuleDocRepeat
  • 可理解性:可读性差,如全大写单词占比过高命中RuleCapitalWords

需要更细的语义判断时,再叠加TEXT_QUALITY_V2QUALITY_BAD_EFFECTIVENESS等 LLM 评估提示词即可。

四类典型用法

本地文本文件

刚把一批网页转成 txt,想先看脏数据占比。执行dingo eval --input local_plaintext.json就能出报告,适合爬虫同学的日更语料巡检。

Hugging Face 数据集

做预训练文本数据集质量检测时,在配置里把 source 设为 hugging_face、指定数据集与字段即可,不用先下载到本地。

JSON / JSONL 文件

SFT 对话、评测集这类结构化数据用 jsonl 源接入,还能按字段分别挂规则:isbn 字段跑 ISBN 校验,title 字段跑文本质量检查。

接入 LLM 做自定义 prompt 评估

规则只抓得住格式层面的问题;对“是否有效、是否通顺”这类语义判断,做 LLM 数据质量评估时可配置LLMTextQualityV4/V5并指向自有模型接口。

谁适合用、什么时候别用

  • 正在清洗预训练或 SFT 语料、训练前想批量筛掉脏数据的算法与数据工程师,是它的核心用户
  • 只想抽查一两条样本、问题又集中在单一字段时,自己写脚本更快,不必引入完整流水线
  • LLM 评估按调用计费、速度受模型接口限制,更适合对规则筛剩的样本做二次精判,而非全量跑

dingo 的思路是把数据质量检测工具做成可插拔的流水线:规则负责快,LLM 负责深,数据源和执行器负责规模。完整指标清单见 docs/metrics.md,各场景指南集中在 docs/。

【免费下载链接】dingoDingo: A Comprehensive AI Data, Model and Application Quality Evaluation Tool项目地址: https://gitcode.com/gh_mirrors/dingo5/dingo

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

http://www.cnnetsun.cn/news/4176304.html

相关文章:

  • 如何10分钟快速部署Sunshine:从零开始的游戏串流完整指南
  • 如何用LLaMA-Factory微调MiniCPM-o-2_6:全模态模型领域适配完整教程
  • ol-plot 入门使用指南:三步把标绘工具接到 OpenLayers 地图上
  • 浏览器里改暗黑破坏神2存档:用 d2s-editor 快速调属性、导物品的完整指南
  • TrollInstallerX 安装 TrollStore 完整教程:4 步装好,iOS 14.0-16.6.1 通用
  • 快捷键失灵了?3 分钟用 Hotkey Detective 揪出偷走全局热键的进程
  • 3 步跑通 Beyond Compare 5 密钥生成:BCompare_Keygen 零基础上手指南
  • LiteRT-LM视觉能力实战:多模态LLM在树莓派上识别图像完整指南
  • Windows苹果驱动安装完整指南:1分钟让iPhone USB网络共享跑起来
  • 抖音去水印下载完整指南:一条命令保存单个视频或整站主页
  • miqu-1-70b量化版本终极选择指南:q2_K、q4_k_m、q5_K_M三大档深度对比
  • ExplorerPatcher 任务栏属性窗口无法打开:4 层排查阶梯,一文搞定
  • OpenCore Legacy Patcher:老 Mac 升级最新 macOS Sequoia 的完整方法
  • AIMNet2-rxn 局限性与完整解决方案:突破 H/C/N/O 元素限制的化学反应模拟策略
  • Keep:把 20 条告警压成 1 个事件,AIOps 告警关联的开源解法
  • 商用前必看:flux-RealismLora非商业许可证避坑指南与风险解读
  • MouseJiggler 从安装到防休眠:一份完整的 Windows 实用指南
  • 开源项目caniuse如何保证554个feature数据的准确性:validate-jsons.js校验机制代码实现深度剖析
  • Great Expectations数据契约:4步给数据流水线装上质检闸
  • Awoo Installer 安装使用指南:3 种通道把 NSP、NSZ、XCI、XCZ 一次装进 Switch
  • WechatHook微信自动化完整指南:一文搞懂微信机器人5大核心玩法
  • 隐私优先的开源联系人+短信神器Connect You:从安装到全面上手的完整指南
  • libheif未来发展方向解析:AVIF标准演进与6大新技术支持
  • react-s-alert 全部 12 个配置项详解:stack、beep、offset 参数完全手册
  • 读懂LLaVA-v1.5-13B的config.json:CLIP视觉塔、mlp2x_gelu投影器与LLaMA-2的8个核心配置参数
  • 压缩包密码找回:4 条命令跑完整份字典,不用装任何软件
  • SMUDebugTool:免费开源的 Ryzen 底层参数调试工具,一个窗口读通 SMU、MSR 与电源表
  • QuickBMS 游戏资源提取:零基础解包到模组回填全解
  • intentrace底层实现(上):ptrace是如何拦截Linux进程每一次系统调用的
  • 揭秘ViTMatte-small-Composition-1k核心架构:Plain ViT如何征服图像抠图任务