当前位置: 首页 > news >正文

厦门大学:DeepSeek大模型赋能高校教学和科研(123页 PPT )

一、大模型:人工智能的前沿
大模型通常指的是大规模的人工智能模型 ,是一种基于深度学习技术 ,具有海量参数、强大的学习能力和泛化能力 ,能够处理和生成多种类型数据的人 工智能模型。通常说的大模型的“大”的特点体现在:1、参数数量庞大;2、训练数据量大;3、计算资源需求高。
大模型的设计和训练旨在提供更强大、 更准确的模型性能 , 以应对更复杂、 更庞大的数据集或任务。 大模型通常能够学习到更细微的模式和规律 ,具有更强的泛化能力和表达能力。人工智能与大模型的关系

人工智能包含了机器学习 ,机器学习包含了深度学习 ,深度学习可以采用不同的模型 , 其中一种模型是预训练模型 ,预训练模型包含了预训练大模型(可以简称为“大模型”) ,预训练大模型包含了预训练大语言模型(可以简称为“大语言模 型”) ,预训练大语言模型的典型代表包括OpenAI的GPT和百度的文心ERNIE , ChatGPT是基于GPT开发的大模型产品, 文心一言是基于文心ERNIE开发的大模型产品

大模型的分类

大模型的基本原理

大模型是基于Transformer架构的 ,这种架构是一种专门用于自然语言处理的“编码-解码器”架构。 在训练过程中 ,大模型将输入的单词以向量的形式传递给神经网络 ,然后通过网络的编码解码以及自注意力机制 ,建立起每个单词之间联系的权 重。大模型的核心能力在于将输入的每句话中的每个单词与已经编码在模型中的单词进行相关性的计算 ,并把相关性又编码 叠加在每个单词中。 这样 ,大模型能够更好地理解和生成自然文本 , 同时还能够表现出一定的逻辑思维和推理能力

二、大模型产品

  1. ChatGPT是一种由OpenAI训练的大语言模型。 它是基于Transformer架构 ,经过大量文本数据训练而成 ,能够生成自然、
    流畅的语言 ,并具备回答问题、 生成文本、 语言翻译等多种功能。ChatGPT的应用范围广泛 , 可以用于客服、 问答系统、 对话生成、
    文本生成等领域。 它能够理解人类语言 ,并能够回答各 种问题 ,提供相关的知识和信息。 与其他聊天机器人相比 ,
    ChatGPT具备更强的语言理解和生成能力 ,能够更自然地与人 类交流 ,并且能够更好地适应不同的领域和场景。
    ChatGPT的训练数据来自互联网上的大量文本 , 因此 , 它能够涵盖多种

  2. Gemini是谷歌发布的大模型 , 它能够同时处理多种类型的数据和任务 , 覆盖文本、 图像、 音频、 视频等多个领域。 Gemini
    采用了全新的架构 ,将多模态编码器和多模态解码器两个主要组件结合在一起 , 以提供最佳结果。Gemini包括三种不同规模的模型:
    Gemini Ultra、 Gemini Pro和Gemini Nano , 适用于不同任务和设备。 2023年12月6日,
    Gemini的初始版本已在Bard中提供 ,开发人员版本可通过Google Cloud的API获得。
    Gemini可以应用于Bard和Pixel 8Pro智能手机。 Gemini的应用范围广泛 ,包括问题回答、 摘要生成、 翻译、
    字幕生成、 情感分析等任务。 然而 , 由于其复杂 性和黑箱性质 , Gemini的可解释性仍然是一个挑战

  3. 2024年2月16日 , OpenAI再次震撼全球科技界 ,发布了名为Sora的文本生成视频大模型 ,只需输入文本就能自动生成视频。 这一技术的诞生,
    不仅标志着人工智能在视频生成领域的重大突破 ,更引发了关于人工智 能发展对人类未来影响的深刻思考。 随着Sora的发布 ,人工智能似乎正 式踏入了通用人工智能(AGI: Artificial General Intelligence) 的时代。
    AGI是指能够像人类一样进行各种智能活动的机器智能 ,包括理解语言、 识别图像、 进行复杂推理等。 Sora大模型能够直接输出长达60秒的视频 , 并且视频中包含了高度细致的背景、 复杂的多角度镜头 , 以及富有情感 的多个角色。 这种能力已经超越了简单的图像或文本生成 ,开始触及到 视频这一更加复杂和动态的媒介。 这意味着人工智能不仅在处理静态信息上越来越强大 , 而且在动态内容的创造上也展现出了惊人的潜力

  4. Sora根据文本自动生成的视频画面 , 一位戴着墨镜、 穿着皮衣的时尚女子走在雨后夜晚的东京市区 街道上 ,抹了鲜艳唇彩的唇角微微翘起 , 即便带着墨 镜也能看到她的微笑 ,地面的积水映出了她的身影和 灯红酒绿的霓虹灯 ,热闹非凡的唐人街正在进行舞龙 表演 ,熙熙攘攘的人群目光都聚焦在跃动的彩龙身上, 整个环境的喜庆氛围仿佛令人身临其境

  5. 国内的大模型产品

    三、大模型的应用领域
    大模型的应用领域非常广泛 ,涵盖了自然语言处理、 计算机视觉、 语音识别、 推荐系统、 医疗健康、 金融风控、 工业制造、生物信息学、 自动驾驶、 气候研究等多个领域




    四、高校本地部署DeepSeek大模型

DeepSeek满血版R1 , 参数高达6710亿( 671B) , 相当于一个 “超级大脑” , 能处理复杂数学题、 编程、 长文本分析等高难度 任务。 部署本地DeepSeek- R1( 671B) 满血版模型 ,支持校园办公自动化、 科研项目辅助、 学术资源分析等多领域应用

2025年2月19日 ,郑州大学国家超级计算中心、 计算机与人工智能学院、 信息化办公室携手攻坚 ,成功在超算中心设备上部署本 地化“满血版” DeepSeek-R1大模型( 671B) 。在多个关键应用领域 , DeepSeek-R1大模型展现出强大的实力

郑州大学DeepSeek-R1系列大模型正在对接学校统一身份认证平台 ,近期将面向全校师生开放试用。同时 , 将根据学校各学科具体需求与硬件条件 , 以具体化、 针对性、 私有化、 学科专用或实验室专用的方式将进一步 将70B、 32B、 14B、 8B、 7B等不同版本的DeepSeek-R1大模型部署到学科内部 ,并接入本地知识库(如学术资源、 课程资源、 实验数据等) , 后期学校将根据具体需求及资源占用情况提供差异化服务 , 构建 “A I +学科 ”垂直领域解 决方案 ,为学科交叉创新发展提供有力支撑

五、基于大模型的智能体

  • 过去的嵌入式工具型 AI助手型工具 (例如siri、小度、小愛音箱) ,只完成和人之间的问答会话。
  • 目前各类 AI Copilot 不再是机械地完成人类指令 ,而是可以参与人类工作流 ,为诸如编写代码、策划活动、优化流程等事项提供建议
    ,与人类协同。
  • AI Agent 的工作仅需给定一个目标 ,它就能够针对目标独立思考并做出行动 ,它会根据给定任务详细拆解出每一步的计划步骤,依靠来自外界的反馈和自主思考 , 自己给自己创建 prompt ,来实现目标。

2025年2月3日 , OpenAI发布了一款新的智能体产品——Deep Research。 Deep Research由OpenAI o3模 型的一个版本提供支持 ,该模型针对网页浏览和数据分析进行了优化 , 它利用推理来搜索、 解释和分析互联网上 的大量文本、 图像和PDF , 并根据需要根据遇到的信息做出调整。 Deep Research具有以下四大核心技术:

【案例】 上海海事大学超级智能体
采取自建大模型+引用AI服务模式 ,A I编排流程使多个智能体综合协作 , 由一颗大脑( LLM) 进行自主支配运行 ,能够根据人的 要求 , 自主判断、 决策、 分解子任务 , 自行与业务系统、 专业知识库、 海事垂直大模型及互联网交互分析 ,构建校级统一AI服务 平台 ,最终输出任务结果 ,从而助学、 助教、 助研、 助管和助国际交流

篇幅有限,仅展示了部分内容。

http://www.cnnetsun.cn/news/1606701.html

相关文章:

  • Bootstrap-WYSIWYG跨浏览器兼容性终极解决方案:如何在所有现代浏览器中完美运行
  • 收藏级指南|Java开发者必看:5个月搞定大模型转型,抢占AI高薪赛道
  • 别再只用TensorBoard了!用Wandb云端协作管理PyTorch实验,效率翻倍
  • 终极BIOS解锁工具:联想笔记本高级设置完全指南
  • 新手入门:通过快马平台学习如何安全卸载openclaw工具
  • 别再只调YOLOv5模型了!测距不准、追踪跳ID?可能是你的相机标定和卡尔曼滤波没做好
  • Penpot零门槛部署:从新手到专家的避坑指南
  • 金融时间序列预测避坑指南:AR/MA/ARMA模型选型与实战案例
  • 如何快速使用ER存档编辑器:艾尔登法环存档修改完整指南
  • 浏览器渲染流程中的那些坑:为什么你的动画总是卡顿?
  • Eureka革命性突破:用GPT-4实现人类级别奖励设计的完整指南
  • Spring Boot 3.5 新特性全解析:开发者必知的 10 大升级
  • 计算机毕业设计springboot智慧课堂数据可视化平台 基于SpringBoot的智能化教学数据分析系统 Java驱动的数字化课堂管理与展示平台
  • 交通运输统计分析主题汇总(2026-03-29更新)
  • Leather Dress Collection基础操作:LoRA权重叠加(如Beltbra+MicroShorts)技巧
  • Java基础面试题汇总
  • ConvNeXt 改进 :ConvNeXt采用WTConv卷积(感受野的小波卷积),ECCV 2024,实现高效涨点,二次创新CNBlock结构 ,独家首发
  • 颠覆传统视频传输:NDI技术与DistroAV插件的高效部署指南
  • 一键部署DeepSeek-R1-8B推理模型:Ollama教程,小白也能5分钟上手
  • Feishin安全设置终极指南:保护你的音乐数据和隐私
  • 从零开始:最新Anaconda+Cuda+cuDNN+Pytorch深度学习环境一站式搭建指南
  • 3D打印机静音升级:用TB67S109AFNG实现超静音微步进驱动(附完整电路图)
  • AI编程工具在代码质量提升方面有哪些具体表现
  • Qwen3-0.6B-FP8惊艳效果:Qwen3-0.6B-FP8在低资源设备上实现类GPT-4交互
  • Ubuntu24.04下Isaacgym安装避坑指南:从虚拟环境到Python版本切换全流程
  • AI IDE 进化论:从代码补全到智能体协作,开发者工作台的范式迁移
  • 《人脸识别为什么在真实场景中经常失效?》——从“算法很强”到“系统失效”的真实原因解析
  • 如何让你的AMD/Intel显卡获得DLSS级画质增强?OptiScaler跨显卡平台配置指南
  • 基于西门子 S7 - 200 PLC 的恒压供水控制系统设计
  • 2026前端面试必杀技:大白话详解高频面试题