相关文章
857 篇高质量内容一文详解大模型训练全过程
深入解析大语言模型训练的每一个关键步骤。 核心内容: 1. 预训练阶段的核心思想与步骤 2. Transformer架构在预训练中的作用 3. 指令微调、奖励模型和强化学习的实现方法
一文说清楚什么是预训练(Pre-Training)、微调(Fine-Tuning)
深入探索AI模型中预训练和微调的奥秘,解锁机器学习在自然语言处理中的高效应用。 核心内容: 1. 预训练的基本概念及其在NLP中的关键作用 2. 微调的定义和在特定任务优化中的重要性 3. 预训练与微调的结合如何提升AI模型性能
DeepSeek 本地部署——蒸馏版、量化版和满血版实测效果对比
掌握DeepSeek本地部署的三种模型性能对比。 核心内容: 1. DeepSeek模型本地部署的背景与必要性 2. 满血版、量化版和蒸馏版模型的硬件需求与部署过程 3. 三种模型在实际应用中的效果实测与对比分析
满足个性化需求,手把手教你微调DeepSeek大模型
掌握DeepSeek大模型微调,释放AI潜能。 核心内容: 1. DeepSeek LLM微调的必要性和基本方法 2. 监督微调技术(SFT)详解及代码实操 3. 损失函数、数据子集选择和LoRA技术要点
DeepSeek V3+R1满血微调工具上线!一键启动,硬件要求降10倍
深度学习领域的最新突破,大幅降低硬件要求,提升模型训练效率。 核心内容: 1. DeepSeek V3/R1 微调工具的发布与特点 2. Colossal-AI 工具箱的丰富功能和兼容性 3. 低成本微调流程和数据集准备指南
昇腾 910B 部署满血 DeepSeek-R1
探索昇腾910B如何高效部署DeepSeek-R1模型,揭示背后的技术细节和挑战。 核心内容: 1. DeepSeek-R1模型的热度及部署需求 2. 昇腾910B部署R1模型的技术方案与挑战 3. 部署过程中的关键步骤和经验分享
飞书多维表格+Deepseek王炸组合,最强AI agent工具
探索AI在办公自动化的新突破,飞书多维表格与Deepseek的完美结合。 核心内容: 1. Deepseek在飞书多维表格中的应用指南 2. 利用AI生成小红书文案的高效操作流程 3. 提示词设置技巧与文本处理的实践案例
谷歌 AI Agent 白皮书 3/3
探索谷歌AI Agent如何通过针对性学习提升模型性能,解锁超越训练数据的高级技能。 核心内容: 1. 模型在现实场景中获取超出训练数据知识的方法 2. 上下文学习、基于检索的上下文学习和基于微调的学习三种针对性学习方法 3. 通过烹饪类比深入理解每种方法的工作原理和应用场景
如何在通义灵码里用上 DeepSeek-V3 和 DeepSeek-R1 满血版 671B 模型?
阿里云通义灵码携手DeepSeek-V3和R1满血版模型,引领AI编程新潮流。 核心内容: 1. 通义灵码支持DeepSeek-V3和DeepSeek-R1满血版671B模型 2. AI程序员功能升级,实现多文件级编码任务自动化 3. 用户可自由切换Qwen 2.5、DeepSeek-V3、DeepSeek-R1模型,提升开发效率
单卡复现 DeepSeek R1 Zero教程来了!
DeepSeek R1 Zero单卡复现技术大揭秘,性价比与性能的完美结合! 核心内容: 1. 单卡复现DeepSeek R1 Zero的可行性分析 2. Unsloth+LoRA技术详解,如何优化性能降低资源消耗 3. 环境搭建与复现步骤指南,轻松上手实践
申请API-KEY,通过接口使用DeepSeek服务
通过API-KEY将GPT模型轻松集成至您的应用,实现智能客服、自动化办公等功能。 核心内容: 1. API Key的概念及其作用 2. 如何申请DeepSeek的API-KEY 3. 使用API-KEY实现WPS接入DeepSeek的示例
DeepSeek零门槛三步极速部署指南,注册秒过,对话零延迟!
极速部署DeepSeek,体验零延迟对话,开启AI应用新篇章! 核心内容: 1. DeepSeek日活1909万,超越ChatGPT的AI应用 2. 三步零门槛部署DeepSeek,华为云、硅基流动、DeepSeek联合打造 3. 获取API密钥、安装Cherry Studio AI客户端、配置Cherry Studio的详细步骤
大模型应用部署过程中流量管控的常见需求和应对方案
深入了解大模型部署中的流量管理策略,提高应用稳定性。 核心内容: 1. DeepSeek API服务需求背景及官方响应 2. DeepSeek模型部署方案及其量化推理优化 3. 阿里云提供的多样化部署方式及操作示例
AI应用开发先了解这些概念:智能体、LLM、RAG、提示词工程
探索AI应用开发的新视角,深入了解智能体、LLM等核心概念。 核心内容: 1. 智能体(Agent)的定义及其与传统人工智能的区别 2. 构建通用智能体平台的关键能力和应用场景 3. 大语言模型(LLM)的工作原理及其训练和使用方式
腾讯云TI平台和HAI部署DeepSeek的步骤及其区别
掌握腾讯云TI和HAI平台的DeepSeek模型部署技巧,提升AI开发效率。 核心内容: 1. 腾讯云TI平台的DeepSeek模型部署全流程 2. HAI平台与TI平台在部署DeepSeek上的差异分析 3. DeepSeek模型选择及其参数配置要点
Chain-of-Action (行动链):从Agent工作流到Agent模型
OpenAI Deep Research引领AI工作流与模型创新,实现复杂任务自动推理。 核心内容: 1. Hugging Face的Open DeepResearch复现工作流 2. 思维链CoT与行动链CoA的耦合机制 3. Agent工作流与Agent模型的区别及应用前景
使用 Apache Dubbo 释放 DeepSeek R1 的全部潜力
Apache Dubbo携手DeepSeek R1,释放AI大模型的无限潜力。 核心内容: 1. DeepSeek R1大模型发布及其开源模型权重 2. Apache Dubbo多语言SDK助力DeepSeek R1企业级部署 3. 本地部署DeepSeek R1的优势及原生部署实践指南
DeepSeek:没用CUDA,没用NVlink,AMD率先拥抱
DeepSeek突破传统硬件依赖,展现AMD在DPU领域的创新实力。 核心内容: 1. DeepSeek如何证明NVLink非必需,DPU替代方案 2. DeepSeek绕过CUDA,采用PTX语言优化硬件指令集 3. PTX、LLVM和CUDA在并行计算中的作用与区别
漫画趣解:一口气搞懂模型蒸馏!
漫画形式轻松讲解模型蒸馏,带你快速掌握AI技术新概念! 核心内容: 1. 模型蒸馏的定义与应用场景 2. 大模型与小模型的对比分析 3. 模型蒸馏的实际操作流程和效果差异
DeepSeek R1多版本性能与负载测试(基于RTX3060+R7 5800+32GB内存实测)
深度学习爱好者必看!本文基于RTX3060+R7 5800+32GB内存,全面实测DeepSeek R1多版本性能与负载,助你选择最适合的模型版本。 核心内容: 1. 实验环境介绍:CPU、显卡、内存配置 2. 性能对比:响应时间、GPU利用率、CPU利用率、内存占用、输出速度 3. 关键发现:资源消耗趋势、模型规模对性能的影响、硬件适配性分析