JOTO
Contact us
← AI 智库
模型与技术专题

模型训练

整理模型训练相关的技术判断、实施方法与企业级实践,重点关注可部署性、安全性和业务价值。

相关文章

857 篇高质量内容
模型训练
模型训练
模型训练

大模型微调(Fine-tuning)全解,需要了解的都在这里

深入解析大模型微调技术,掌握AI模型优化的关键步骤。 核心内容: 1. 大模型微调的基本概念与重要性 2. 全量微调与高效微调的对比分析 3. 全量指令微调在对话模型中的应用实例

模型训练
模型训练
模型训练

LoRA 介绍

理解PEFT技术及其在大型语言模型中的应用。 核心内容: 1. PEFT的必要性与常用微调方法 2. Adapters技术及其优势 3. LoRA技术详解与应用实例

模型训练
模型训练
模型训练

LLM 联网搜索,到底是咋回事?

探索本地聊天助手搭建全过程,揭秘模型联网搜索技术。 核心内容: 1. DeepSeek服务火爆原因及其局限性 2. 本地模型环境搭建步骤及Docker配置 3. 联网搜索功能的实现和自定义LLM工具使用

模型训练
模型训练
模型训练

在火山引擎部署DeepSeek,更快、更省、更安全

通过火山引擎部署DeepSeek,实现AI推理的高效、低成本和安全。 核心内容: 1. 大规模AI推理带来的技术挑战及现有IT能力局限 2. 火山方舟调用DeepSeek服务的优势与性能表现 3. 火山引擎AI云原生支持DeepSeek部署的实践步骤与优化效果

模型训练
模型训练
模型训练

零基础入门:DeepSeek微调教程来了!

深入浅出,带你轻松掌握DeepSeek微调技巧! 核心内容: 1. 微调前后效果对比展示 2. 大模型微调概念及类比解释 3. 生活案例助你理解微调过程

模型训练
模型训练
模型训练

本地部署DeepSeek安全风险自查及安全加固方案

深入了解本地部署DeepSeek的安全风险及加固方案,保障AI技术安全落地。 核心内容: 1. DeepSeek本地部署的安全风险分析 2. Ollama服务配置导致的安全问题 3. 实施安全自查与加固的具体方法

模型训练
模型训练
模型训练

Ragflow v0.16部署实践

RAGFlow v0.16版本部署指南,涵盖Docker与Kubernetes部署技巧。 核心内容: 1. Docker部署RAGFlow的硬件要求和操作步骤 2. Kubernetes部署文档和大规模部署优势 3. RAGFlow与LLM集成的多种方式与配置技巧

模型训练
模型训练
模型训练

基于多教师蒸馏的持续学习技术

在人工智能快速发展的今天,如何让AI模型像人类一样持续学习和进步,是一个极具挑战性的问题。本文深入剖析了基于多教师蒸馏的持续学习技术,为解决AI模型的灾难性遗忘问题提供了新思路。 核心内容: 1. 持续学习技术的核心理念及面临的挑战 2. 基于多教师蒸馏的持续学习技术原理与优势 3. 该技术在实际应用中的效果分析与展望

模型训练
模型训练
模型训练

核弹级产品 MetaGPT X 发布:一键生成全栈应用程序!

一键生成全栈应用,MetaGPT X引领软件开发新革命。 核心内容: 1. MetaGPT X产品介绍及其在软件开发领域的应用 2. MetaGPT X的多智能体协作和全流程服务能力 3. MetaGPT X对程序员职业的影响和未来趋势

模型训练
模型训练
模型训练

通义灵码 + DeepSeek:AI 编程助手的强强联合,让开发效率飙升!

AI编程助手的新突破,通义灵码与DeepSeek模型强强联合,助力开发者效率飞跃。 核心内容: 1. 通义灵码的多语言支持和强大功能集成 2. DeepSeek-V3和DeepSeek-R1模型的性能特点 3. 通义灵码结合DeepSeek模型带来的全新编程体验

模型训练
模型训练
模型训练

某安全团队针对网安大模型的微调初体验

深度解析AI模型微调在网络安全领域的实际应用,实战案例分享。 核心内容: 1. AI模型微调定义及其与开源模型的区别 2. 微调过程中的数据集选择与泛化能力挑战 3. 微调模型在SQL注入和后门检测中的应用实例

模型训练
模型训练
模型训练

DeepSeek R1 70B本地版和官网版测试: 思考深度、内容结构、语言风格、搜索能力有出入

深入对比DeepSeek R1 70B本地版与官网版性能差异,探索不同部署环境下的表现。 核心内容: 1. 70B版本本地部署性能测试 2. 官网版与本地版在思考深度、内容结构、语言风格上的对比 3. 服务器配置Page Assist UI插件的步骤及网络搜索功能测试

模型训练
模型训练
模型训练

一文搞懂DeepSeek - 基于R1蒸馏Qwen1.5B

探索知识蒸馏的前沿技术,了解如何通过DeepSeek将R1的强大推理能力迁移至Qwen-1.5B,实现性能与效率的双重飞跃。 核心内容: 1. 知识蒸馏技术及其在AI模型优化中的应用 2. DeepSeek技术如何实现R1到Qwen-1.5B的知识迁移 3. 蒸馏过程的具体步骤与模型性能对比分析

模型训练
模型训练
模型训练

基于Ubuntu Ollama 部署 DeepSeek-R1:32B 聊天大模型(附带流式接口调用示例)

掌握高性能聊天大模型的部署与调用技巧。 核心内容: 1. DeepSeek-R1:32B模型介绍与部署背景 2. 基于Ubuntu和Docker的部署流程详解 3. 流式接口调用实例与优化下载技巧

模型训练
模型训练
模型训练

DeepSeek-R1第三方稳定性测试(API端):首批结果出炉!

深度分析DeepSeek-R1 API端稳定性测试结果,了解各平台性能差异。 核心内容: 1. DeepSeek-R1 API稳定性测评背景及方法 2. 各第三方平台回复率、输出效率对比 3. 准确率差异及应用场景建议

模型训练
模型训练
模型训练

企业AI私有化终极方案:DeepSeek-R1蒸馏实战全解析

企业AI私有化部署的新标杆:DeepSeek-R1蒸馏技术深度解析 核心内容: 1. Kiln框架技术:全自动模型蒸馏流水线架构与核心创新 2. 企业级应用实测:医疗行业案例分析与技术突破点 3. 混合云部署方案:成本控制与技术选型指南

模型训练
模型训练
模型训练

实测Grok3效果到底如何!发现中文好像蒸馏了Qwen!

深度测评Grok3性能,中文能力媲美Qwen,体验超速响应! 核心内容: 1. Grok3中文能力实测,对比Qwen模型 2. think版与普通版性能对比,任务适用性分析 3. 特殊测试案例解析,包括字母反转和数字比较

模型训练
模型训练
模型训练

1.5B小模型逆袭!DeepScaleR如何用强化学习颠覆AI数学竞赛规则

在AI领域,小型模型如何逆袭?伯克利团队的DeepScaleR模型给出了答案! 核心内容: 1. 1.5B参数小模型如何超越大规模模型 2. DeepScaleR的创新训练方法:迭代式上下文扩展 3. 强化学习奖励机制的应用与效果

模型训练
模型训练
模型训练

实战教程:用一张4090显卡+512GB内存部署671B的Deepseek大模型

最新技术突破,低成本部署高性能大模型! 核心内容: 1. 清华大学MADSys团队开源KTransformers算法框架 2. 4090显卡+512GB内存部署671B Deepseek模型实操 3. 详细环境配置与编译安装步骤指南

模型训练
模型训练
模型训练

DeepSeek-R1微调指南

掌握DeepSeek-R1微调技巧,优化AI模型性能,无需昂贵硬件支持。 核心内容: 1. DeepSeek-R1微调的背景和重要性 2. 使用LoRA和Unsloth在消费级GPU上微调DeepSeek-R1的步骤 3. LangChat项目介绍及其支持的AI大模型列表