JOTO
Contact us
← AI 智库
模型与技术专题

模型训练

整理模型训练相关的技术判断、实施方法与企业级实践,重点关注可部署性、安全性和业务价值。

相关文章

857 篇高质量内容
模型训练
模型训练
模型训练

一文详解大模型训练全过程

深入解析大语言模型训练的每一个关键步骤。 核心内容: 1. 预训练阶段的核心思想与步骤 2. Transformer架构在预训练中的作用 3. 指令微调、奖励模型和强化学习的实现方法

模型训练
模型训练
模型训练

一文说清楚什么是预训练(Pre-Training)、微调(Fine-Tuning)

深入探索AI模型中预训练和微调的奥秘,解锁机器学习在自然语言处理中的高效应用。 核心内容: 1. 预训练的基本概念及其在NLP中的关键作用 2. 微调的定义和在特定任务优化中的重要性 3. 预训练与微调的结合如何提升AI模型性能

模型训练
模型训练
模型训练

DeepSeek 本地部署——蒸馏版、量化版和满血版实测效果对比

掌握DeepSeek本地部署的三种模型性能对比。 核心内容: 1. DeepSeek模型本地部署的背景与必要性 2. 满血版、量化版和蒸馏版模型的硬件需求与部署过程 3. 三种模型在实际应用中的效果实测与对比分析

模型训练
模型训练
模型训练

满足个性化需求,手把手教你微调DeepSeek大模型

掌握DeepSeek大模型微调,释放AI潜能。 核心内容: 1. DeepSeek LLM微调的必要性和基本方法 2. 监督微调技术(SFT)详解及代码实操 3. 损失函数、数据子集选择和LoRA技术要点

模型训练
模型训练
模型训练

DeepSeek V3+R1满血微调工具上线!一键启动,硬件要求降10倍

深度学习领域的最新突破,大幅降低硬件要求,提升模型训练效率。 核心内容: 1. DeepSeek V3/R1 微调工具的发布与特点 2. Colossal-AI 工具箱的丰富功能和兼容性 3. 低成本微调流程和数据集准备指南

模型训练
模型训练
模型训练

昇腾 910B 部署满血 DeepSeek-R1

探索昇腾910B如何高效部署DeepSeek-R1模型,揭示背后的技术细节和挑战。 核心内容: 1. DeepSeek-R1模型的热度及部署需求 2. 昇腾910B部署R1模型的技术方案与挑战 3. 部署过程中的关键步骤和经验分享

模型训练
模型训练
模型训练

飞书多维表格+Deepseek王炸组合,最强AI agent工具

探索AI在办公自动化的新突破,飞书多维表格与Deepseek的完美结合。 核心内容: 1. Deepseek在飞书多维表格中的应用指南 2. 利用AI生成小红书文案的高效操作流程 3. 提示词设置技巧与文本处理的实践案例

模型训练
模型训练
模型训练

谷歌 AI Agent 白皮书 3/3

探索谷歌AI Agent如何通过针对性学习提升模型性能,解锁超越训练数据的高级技能。 核心内容: 1. 模型在现实场景中获取超出训练数据知识的方法 2. 上下文学习、基于检索的上下文学习和基于微调的学习三种针对性学习方法 3. 通过烹饪类比深入理解每种方法的工作原理和应用场景

模型训练
模型训练
模型训练

如何在通义灵码里用上 DeepSeek-V3 和 DeepSeek-R1 满血版 671B 模型?

阿里云通义灵码携手DeepSeek-V3和R1满血版模型,引领AI编程新潮流。 核心内容: 1. 通义灵码支持DeepSeek-V3和DeepSeek-R1满血版671B模型 2. AI程序员功能升级,实现多文件级编码任务自动化 3. 用户可自由切换Qwen 2.5、DeepSeek-V3、DeepSeek-R1模型,提升开发效率

模型训练
模型训练
模型训练

单卡复现 DeepSeek R1 Zero教程来了!

DeepSeek R1 Zero单卡复现技术大揭秘,性价比与性能的完美结合! 核心内容: 1. 单卡复现DeepSeek R1 Zero的可行性分析 2. Unsloth+LoRA技术详解,如何优化性能降低资源消耗 3. 环境搭建与复现步骤指南,轻松上手实践

模型训练
模型训练
模型训练

申请API-KEY,通过接口使用DeepSeek服务

通过API-KEY将GPT模型轻松集成至您的应用,实现智能客服、自动化办公等功能。 核心内容: 1. API Key的概念及其作用 2. 如何申请DeepSeek的API-KEY 3. 使用API-KEY实现WPS接入DeepSeek的示例

模型训练
模型训练
模型训练

DeepSeek零门槛三步极速部署指南,注册秒过,对话零延迟!

极速部署DeepSeek,体验零延迟对话,开启AI应用新篇章! 核心内容: 1. DeepSeek日活1909万,超越ChatGPT的AI应用 2. 三步零门槛部署DeepSeek,华为云、硅基流动、DeepSeek联合打造 3. 获取API密钥、安装Cherry Studio AI客户端、配置Cherry Studio的详细步骤

模型训练
模型训练
模型训练

大模型应用部署过程中流量管控的常见需求和应对方案

深入了解大模型部署中的流量管理策略,提高应用稳定性。 核心内容: 1. DeepSeek API服务需求背景及官方响应 2. DeepSeek模型部署方案及其量化推理优化 3. 阿里云提供的多样化部署方式及操作示例

模型训练
模型训练
模型训练

AI应用开发先了解这些概念:智能体、LLM、RAG、提示词工程

探索AI应用开发的新视角,深入了解智能体、LLM等核心概念。 核心内容: 1. 智能体(Agent)的定义及其与传统人工智能的区别 2. 构建通用智能体平台的关键能力和应用场景 3. 大语言模型(LLM)的工作原理及其训练和使用方式

模型训练
模型训练
模型训练

腾讯云TI平台和HAI部署DeepSeek的步骤及其区别

掌握腾讯云TI和HAI平台的DeepSeek模型部署技巧,提升AI开发效率。 核心内容: 1. 腾讯云TI平台的DeepSeek模型部署全流程 2. HAI平台与TI平台在部署DeepSeek上的差异分析 3. DeepSeek模型选择及其参数配置要点

模型训练
模型训练
模型训练

Chain-of-Action (行动链):从Agent工作流到Agent模型

OpenAI Deep Research引领AI工作流与模型创新,实现复杂任务自动推理。 核心内容: 1. Hugging Face的Open DeepResearch复现工作流 2. 思维链CoT与行动链CoA的耦合机制 3. Agent工作流与Agent模型的区别及应用前景

模型训练
模型训练
模型训练

使用 Apache Dubbo 释放 DeepSeek R1 的全部潜力

Apache Dubbo携手DeepSeek R1,释放AI大模型的无限潜力。 核心内容: 1. DeepSeek R1大模型发布及其开源模型权重 2. Apache Dubbo多语言SDK助力DeepSeek R1企业级部署 3. 本地部署DeepSeek R1的优势及原生部署实践指南

模型训练
模型训练
模型训练

DeepSeek:没用CUDA,没用NVlink,AMD率先拥抱

DeepSeek突破传统硬件依赖,展现AMD在DPU领域的创新实力。 核心内容: 1. DeepSeek如何证明NVLink非必需,DPU替代方案 2. DeepSeek绕过CUDA,采用PTX语言优化硬件指令集 3. PTX、LLVM和CUDA在并行计算中的作用与区别

模型训练
模型训练
模型训练

漫画趣解:一口气搞懂模型蒸馏!

漫画形式轻松讲解模型蒸馏,带你快速掌握AI技术新概念! 核心内容: 1. 模型蒸馏的定义与应用场景 2. 大模型与小模型的对比分析 3. 模型蒸馏的实际操作流程和效果差异

模型训练
模型训练
模型训练

DeepSeek R1多版本性能与负载测试(基于RTX3060+R7 5800+32GB内存实测)

深度学习爱好者必看!本文基于RTX3060+R7 5800+32GB内存,全面实测DeepSeek R1多版本性能与负载,助你选择最适合的模型版本。 核心内容: 1. 实验环境介绍:CPU、显卡、内存配置 2. 性能对比:响应时间、GPU利用率、CPU利用率、内存占用、输出速度 3. 关键发现:资源消耗趋势、模型规模对性能的影响、硬件适配性分析