当前位置: 首页 > news >正文

数据集初识

1.在线加载数据集

代码:

importos# 设置环境变量,所有Hugging Face请求都会通过镜像站os.environ['HF_ENDPOINT']='https://hf-mirror.com'fromdatasetsimportload_dataset,load_from_disk#在线加载数据集datasets=load_dataset(path="lansinuote/ChnSentiCorp",cache_dir="data/")print(datasets)

运行结果:

To support symlinks on Windows,you either need to activate Developer Modeorto run Pythonasan administrator.In order to activate developer mode,see this article:https://docs.microsoft.com/en-us/windows/apps/get-started/enable-your-device-for-development warnings.warn(message)Generating train split:100%|██████████|9600/9600[00:00<00:00,157051.44examples/s]Generating validation split:100%|██████████|1200/1200[00:00<00:00,280524.18examples/s]Generating test split:100%|██████████|1200/1200[00:00<00:00,344619.29examples/s]DatasetDict({train:Dataset({features:['text','label'],num_rows:9600})validation:Dataset({features:['text','label'],num_rows:1200})test:Dataset({features:['text','label'],num_rows:1200})})进程已结束,退出代码为0
#### **加载统计**: |数据集划分 |样本数量 |加载速度 |用时 | |-------|------|----------|-----| |**训练集**|9,600条|157,051条/秒|<0.1秒| |**验证集**|1,200条|280,524条/秒|<0.1秒| |**测试集**|1,200条|344,619条/秒|<0.1秒|

2.离线加载数据集

首先,将缓存数据保存到磁盘

# 2. 保存到磁盘save_path=r"D:\develop\pypro\LLM\LLMPro\01-大模型应用基础\data\chn_senti_corp_saved"datasets.save_to_disk(save_path)print(f"\n 数据集已保存到:{save_path}")

其次,离线加载数据集,并输出train训练集数据

dataset=load_from_disk(r"D:\develop\pypro\LLM\LLMPro\01-大模型应用基础\data\chn_senti_corp_saved")forkindataset["train"]:print(k)

训练集结果输出text和label两个特征量:

{'text':'这书我看他的丰面时就感觉它是给我一个希望的书,可一看和我的想反了.没什么帮助的.就是觉的失败','label':0}{'text':'内存数量配置偏低 内存插槽于掌托下,需拆卸安装,不方便 蓝牙模块采用软件控制','label':0}.........{'text':'虽是观景房,不过我住的楼层太低(19楼)看不到江景,但地点很好,离轻轨临江门站和较场口站(起点)很近,解放碑就在附近(大约100多公尺吧)!','label':1}{'text':'性价比不错,交通方便。行政楼层感觉很好,只是早上8点楼上装修,好吵。 中餐厅档次太低,虽然便宜,但是和酒店档次不相配。','label':1}{'text':'跟心灵鸡汤没什么本质区别嘛,至少我不喜欢这样读经典,把经典都解读成这样有点去中国化的味道了','label':0}进程已结束,退出代码为0


在这里数据集是.arrow格式的,一般我们自建的数据集是.csv格式的,加载代码如下:

dataset=load_dataset(r"D:\develop\pypro\LLM\LLMPro\01-大模型应用基础\data\mobile_test01.csv")

如果想将.arrow格式的转换为.csv格式,可以试一试以下代码:

datasets.to_csv(path_or_buf=r"D:\develop\pypro\LLM\LLMPro\01-大模型应用基础\data\chn_senti_corp_saved.csv")
http://www.cnnetsun.cn/news/40072.html

相关文章:

  • 解放搜索时间!SearchEngineJumpPlus让你告别重复复制粘贴
  • AI视频生成终极指南:腾讯HunyuanVideo 1.5完整部署教程
  • 46、Python 网络编程与套接字全解析
  • 微信自动答题小工具终极指南:Python开发者的效率利器
  • 实战指南:从零开始掌握Langflow自定义组件开发
  • FastAPI性能优化深度解析:从基础到高级实践
  • 5分钟掌握wandb:解决机器学习实验混乱的终极指南
  • ISO/IEC 27005:2022完整教程:信息安全风险管理终极指南
  • 巫妖易语言+js逆向+安卓逆向hook培训教程
  • 5个实用技巧彻底解决PhpSpreadsheet内存不足问题
  • JMeter接口测试之文件上传
  • 从零开始:5步搞定BDD100K数据集训练,新手也能轻松上手![特殊字符]
  • java计算机毕业设计陕西理工大学返校管理系统 高校学生返校审批与宿舍信息一体化平台 基于Vue+SpringBoot的校园返校及住宿服务系统
  • 36亿参数撬动韩国AI生态:Kakao Kanana-1.5-v-3b-instruct多模态模型深度解析
  • 如何用AI快速修复老旧视频?SeedVR2-7B让1080P修复仅需0.8秒
  • 轻量级AI新范式:重新定义企业智能部署的终极方案
  • OpenMower测试实战:从零到一的智能割草机器人验证指南
  • MotionGPT终极指南:用语言模型生成人类运动的完整方法
  • TL494 BUCK电路完整指南:从原理到PCB制作的实战教程
  • ZVT量化框架模块化设计终极指南:5步快速上手智能交易系统
  • 10、深入理解SELinux类型规则与Apol工具的使用
  • 视频生成技术革命:LightVAE如何重塑创作效率边界
  • WordPress 专业建筑行业公司网站主题模板 – Constructo v5.0.0
  • noVNC剪贴板同步完全指南:解决远程复制粘贴难题
  • FusionSpec投机推理:让大模型推理速度飙升的优化策略
  • WPS VBA 7.1插件技术实现与自动化办公解决方案深度解析
  • Qwen3-VL-4B-Instruct-FP8:如何用40亿参数重塑企业级多模态AI生态?
  • Logto身份认证系统入门指南:从零构建安全登录体系
  • 【Java毕设全套源码+文档】基于Java的教学评价管理系统的设计与实现(丰富项目+远程调试+讲解+定制)
  • 【Java毕设全套源码+文档】基于Java的教务管理系统设计与实现(丰富项目+远程调试+讲解+定制)