JOTO
联系我们
← AI 智库
模型与技术专题

模型训练

整理模型训练相关的技术判断、实施方法与企业级实践,重点关注可部署性、安全性和业务价值。

相关文章

857 篇高质量内容
模型训练
模型训练
模型训练

DeepSeek R1私有部署GPU选择指南(英伟达A100、H100、A800、H800、H20系列)

掌握DeepSeek R1私有部署的GPU选择,提高业务效率与性能。 核心内容: 1. DeepSeek R1不同版本应用场景解析 2. 英伟达A100、H100、A800、H800、H20系列GPU性能对比 3. 根据业务需求选择合适的GPU型号与部署策略

模型训练
模型训练
模型训练

OpenManus+QwQ32B 本地部署

本地部署OpenManus和QwQ-32B的详细指南,助你快速搭建个人AI环境。 核心内容: 1. QwQ-32B本地运行和ollalma部署步骤 2. OpenManus环境搭建和依赖安装 3. OpenManus配置文件设置和API密钥管理

模型训练
模型训练
模型训练

单卡4090部署DeepSeek-R1到底能抗多大量?性能压测来了

老码农如何用AI辅助开发性能测试脚本,节省大量调试时间。 核心内容: 1. 利用AI辅助开发性能测试脚本的经历分享 2. 脚本参数设置与使用样例 3. 压测结果输出示例与性能指标分析

模型训练
模型训练
模型训练

Deepseek-R1不支持Function Call?不能搭建智能体?教你一招

掌握DeepSeek-R1的替代方案,打造功能强大的智能体。 核心内容: 1. DeepSeek-R1不支持Function Call的挑战 2. 通过定制化微调和外部集成的解决方案 3. 实际应用案例和开源项目介绍

模型训练
模型训练
模型训练

快速上手:开发第一个MCP Server

快速掌握MCP Server开发,提升AI应用能力。 核心内容: 1. MCP Server对AI应用支持情况 2. 配置环境及代码实现MCP Server 3. 使用Cline测试MCP Server连接

模型训练
模型训练
模型训练

在Ubuntu服务器4x2080ti(22G)上部署QwQ-32B + SGLang教程

深入了解SGLang框架在Ubuntu服务器上的部署技巧,掌握大型语言模型的高效运行方法。 核心内容: 1. SGLang框架的核心功能与优势 2. SGLang的安装步骤与环境配置 3. 在Ubuntu服务器上部署QwQ-32B模型的具体流程

模型训练
模型训练
模型训练

MCP Server 开发必备:MCP Inspector 调试工具

掌握MCP服务器开发,MCP Inspector调试工具不可或缺。 核心内容: 1. MCP Inspector工具介绍及快速启动方法 2. 功能全面:资源元数据检查与执行结果可视化 3. 从基础测试到复杂边界条件验证的完整工作流指南

模型训练
模型训练
模型训练

AI一周写出ICLR研讨会论文!成果简洁有效获审稿人大赞

AI一周内产出两篇ICLR研讨会论文,效率与质量双双惊艳审稿人。 核心内容: 1. AI科学家Zochi一周内独立完成两篇论文,均获高评分 2. CS-ReFT方法使7B Llama-2在AlpacaEval中超越GPT-3.5 3. Siege框架针对大模型安全漏洞检测实现100%准确率

模型训练
模型训练
模型训练

Prompt caching,一篇就够了。

掌握Prompt Caching,高效降低AI模型延迟和成本。 核心内容: 1. Prompt Caching概念及必要性解析 2. Prompt Caching的工作机制和实现方法 3. 用户和开发者如何应用Prompt Caching以优化性能

模型训练
模型训练
模型训练

「AI开发进入USB时代!」Cherry Studio+MCP协议实测:3分钟连通本地/云端/API,效率飙升10倍!

快速连通AI开发新纪元,效率提升10倍! 核心内容: 1. Cherry Studio与MCP协议的整合应用 2. 安装配置Cherry Studio最新版本及MCP服务 3. 实现本地/云端/API快速连通的详细步骤

模型训练
模型训练
模型训练

Cursor实战:高效搞定多表关联

深入探索Cursor在多表关联场景下的强大功能,提升全栈开发效率。 核心内容: 1. 从单表到多表,Cursor全栈开发能力展示 2. 项目资源管理模块的业务背景与技术框架 3. 多表关联建表SQL及代码生成工具的应用

模型训练
模型训练
模型训练

大模型微调:全量微调 VS Lora微调,一篇说清楚

深入解析人工智能大模型微调技术,掌握全量微调和LoRA微调的区别与应用场景。 核心内容: 1. 全量微调的定义、特点及其适用场景 2. LoRA微调的原理、优势和资源需求 3. 两种微调方法的比较及企业实际应用考量

模型训练
模型训练
模型训练

使用DeepSeek Function Calling构建智能测试助手

AI技术如何革新软件测试领域?本文深入解析大语言模型的函数调用能力在智能测试助手中的应用。 核心内容: 1. 大语言模型技术在测试自动化中的应用前景 2. Function Calling技术解析与参数定义示例 3. 传统测试与函数调用方式的技术优势对比及实现方式

模型训练
模型训练
模型训练

MCP 传输协议改进提案解读:从 HTTP+SSE 到"可流式 HTTP"

探索"可流式 HTTP"协议如何革新MCP传输效率,实现更灵活的服务器消息处理。 核心内容: 1. 新提案"可流式 HTTP"的主要变更点 2. 替代HTTP+SSE的优势和兼容性 3. 无状态和有状态服务器的实现示例

模型训练
模型训练
模型训练

从 0 到 1,Agentic Ops 如何打造企业级 AI 生产力?

Agentic Ops引领企业AI生产力革命,构建全周期智能体开发与优化框架。 核心内容: 1. Agent技术重塑人机交互与智能化应用落地 2. Agentic Ops框架标准化智能体开发、部署和优化流程 3. 产品矩阵构建Agent基础设施,助力企业从0到1打造智能体

模型训练
模型训练
模型训练

挑战4张2080Ti22G跑本地部署的DeepSeek 671b满血版大模型

低成本实现高性能大模型部署,个人PC也能畅享DeepSeek R1 671B。 核心内容: 1. 针对DeepSeek大模型本地部署的硬件与软件配置详解 2. 优化参数设置,避免内存溢出,提升显存使用效率 3. 实际运行效果展示,包括模型加载、提问及运行速率

模型训练
模型训练
模型训练

比DeepSeek、o1高3倍!首创无服务器强化微调,只需十几个数据点,

AIGC领域重大突破!Predibase发布首个无服务器强化微调平台RFT,显著提升大语言模型性能。 核心内容: 1. Predibase发布端到端强化微调平台RFT,支持无服务器和端到端训练 2. RFT通过奖励和自定义函数完成强化学习,大幅减少对标注数据的依赖 3. RFT微调后的Qwen2.5-Coder-32B-instruct模型性能显著提升,正确率是DeepSeek、o1的3倍以上

模型训练
模型训练
模型训练

5种微调大语言模型(LLMs)的技术,一图看懂!

掌握前沿微调技术,提升AI模型性能。 核心内容: 1. LoRA技术及其高效微调优势 2. LoRA-FA、VeRA、Delta-LoRA和LoRA+的创新点 3. 五种微调技术的应用场景和性能优化

模型训练
模型训练
模型训练

MCP协议或迎来重大更新:引入Streamable HTTP传输

MCP协议最新变革,开启Streamable HTTP传输新时代。 核心内容: 1. Streamable HTTP传输机制的引入及其主要变化 2. 更新的动机和当前HTTP+SSE传输的问题 3. 新协议的优势及不同服务器类型下的应用场景

模型训练
模型训练
模型训练

DeekSeek-R1大模型本地微调-构建医疗问答模型

利用Kaggle Notebook和开源数据集,本地微调DeepSeek-R1大模型,构建高效医疗问答系统。 核心内容: 1. 注册wandb账号,获取API key,实现训练过程可视化 2. 通过hugging face国内镜像网站下载DeepSeek-R1模型和医疗问答数据集 3. 安装必要Python包,开始DeepSeek-R1模型的本地微调(finetuning)