JOTO
联系我们
← AI 智库
模型与技术专题

多模态模型

整理多模态模型相关的技术判断、实施方法与企业级实践,重点关注可部署性、安全性和业务价值。

相关文章

483 篇高质量内容
多模态模型
多模态模型
多模态模型

DeepSeek小模型长了眼睛,Agent基准干翻顶级闭源模型

DeepSeek发布V4-Flash-Vision-Exp多模态视觉实验版,在Agents' Last Exam和ZeroBench等Agent基准测试中超越Opus-4.8等顶级闭源模型;视觉能力加入后文本性能未下降,且图片token消耗仅384个,Files API免费;该模型聚焦Agent工作流闭环,验证了轻量级多模态Agent能力的可行性。

多模态模型
多模态模型
多模态模型

V4-Flash-Vision-Exp 上线,开启多模态 API 服务

DeepSeek 推出实验性多模态视觉理解模型 V4-Flash-Vision-Exp,通过 API 提供图文混合输入支持。该模型在纯文本能力上与 V4-Flash 持平,在多模态 Agent 基准测试中表现接近 Opus-4.8。支持 Chat Completions 等三种调用格式及 Files API 图片复用,计费按 token 统一标准。

多模态模型
多模态模型
多模态模型

DeepSeek Harness 更新:官方多模态支持

DeepSeek Harness 连续发布 v0.1.0-rc.7、v0.1.0-rc.8 和 v0.1.1-rc.1 三个版本,重点增强多模态能力(新增 DeepSeek-V4-Flash-Vision-Exp 模型支持图文输入)、子代理协作灵活性(Codex/Claude Code 接入 Job Panel)及稳定性(修复长会话、终端兼容等问题)。MCP/ACP 支持图片附件持久化,PTC Mode 支持转发嵌套图片。

多模态模型
多模态模型
多模态模型

DeepSeek终于长出“眼睛”,V4 Flash视觉模型上线

DeepSeek于8月21日上线deepseek-v4-flash-vision-exp,为其V4 Flash模型首次引入原生图片输入能力。该模型支持1M上下文、384K输出长度,沿用V4 Flash同档定价,图片按尺寸折算为Token计费。其发布紧随Harness框架更新之后,旨在补全Agent系统的感知入口,当前仍标注为实验版本(Exp)。

多模态模型
多模态模型
多模态模型

昨夜,DeepSeek Harness首发新版本:14项更新,多模态能力拉满!

DeepSeek Harness于8月20日发布v0.1.0-rc.8版本,共14项更新,重点增强多模态输入能力,支持原生图片请求与图文混合指令;新增OCR、颜色统计、像素扫描等工具链,使纯文本模型可间接处理图像;Claude Code与Codex接入子代理体系,Windows终端体验优化,并修复流式生成、大图请求、自定义网关调用等关键问题。

多模态模型
多模态模型
多模态模型

DeepSeek Harness重磅更新:原生解锁多模态

DeepSeek Harness RC.8版本发布,原生支持多模态图文输入,/goal、/plan等命令可接收图片;Claude Code与Codex作为Profile Bundle按需安装;修复图片载荷过高导致请求失败等问题,并优化SQLite后端性能与界面交互体验。

开源模型
开源模型
开源模型

Qwen3.8-27B:可在高端笔记本本地运行的前沿级编码与智能体模型

阿里巴巴发布开源多模态模型Qwen3.8-27B,仅需17GB显存即可在消费级设备运行,支持图像/视频理解、超长上下文与智能体工作流,在多项编程与智能体基准中媲美Claude Opus等专有模型。

开源模型
开源模型
开源模型

太快了!聊聊 DeepSeek Harness 必装的插件。

DeepSeek Harness 基于 Cordis 插件系统构建,社区已快速开发出覆盖开发体验(WebUI 增强、TUI、桌面端)、视觉/多模态(识图、OCR、本地视觉模型代理)、记忆与工作流(本地三层记忆、自动化任务、多 Agent 调度)、工具集(数据库连接、设计画布、插件市场)等方向的数十个插件。文章逐一介绍 dsh-better-sidebar、dsh-TUI、deepseek-harness-desktop、dsh-vision-toolkit、dsh-mnemon、dsh-workflow 等核心插件的功能、安装方式与适用场景。

开源模型
开源模型
开源模型

17GB内存就能跑!阿里开源最强27B多模态Qwen3.8,消费级显卡直接上

阿里开源Qwen3.8-27B原生多模态稠密模型,支持26.2万token上下文(可扩展至100万),Apache 2.0协议。Unsloth提供Dynamic GGUF量化方案,4bit仅需17–19GB内存,2bit可压至11–13GB,消费级显卡或24GB内存Mac即可本地部署。视觉能力原生集成,编码(SWE-bench Pro 61.7)、办公(CoWorkBench 70.7)及长视频理解表现突出。

大语言模型
大语言模型
大语言模型

智体新境|从模型到端侧,Google AI 开发全链路升级

2026 Google 开发者大会集中展示 Google AI 在模型能力、多模态、智能体开发与端侧部署四个层面的最新进展。Gemini 3 系列与 Gemma 4 开放模型提供差异化选择;Gemini Omni Flash、Lyria 3 和 Live API 推进多模态交互;AI Studio、Antigravity 2.0 与 Gemini API 构建智能体开发闭环;MediaPipe Tasks、LiteRT-LM 与 LiteRT 形成分层端侧技术栈。

开源模型
开源模型
开源模型

Meta 发布 Apache 2.0 许可的 30B 多模态智能体模型 Muse Glimmer,支持 24GB 消费级硬件本地运行

Meta 推出开源权重模型 Muse Glimmer(29.6B 参数),采用 Apache 2.0 许可证,专为本地自主智能体设计,支持文本-图像交错输入、工具调用与错误恢复,并可在 24GB VRAM 设备上量化运行。

开源模型
开源模型
开源模型

微软开源Orchard:一个让AI智能体“动手干活”的统一平台

微软开源Orchard框架,提供统一的Orchard Env操作环境服务,支持AI智能体在代码、浏览器与通用计算机环境中执行真实任务。其核心价值在于标准化沙箱基础设施、预置主流Agent Harness、高效并行能力(1000环境/26秒)及三类落地Recipe(SWE/GUI/Claw),并开源107K条SWE轨迹与3K条GUI多模态数据集。

大语言模型
大语言模型
大语言模型

Qwen3.8-Max发布:2.4万亿参数MoE多模态模型挑战智能体计算前沿

阿里巴巴Qwen团队发布Qwen3.8-Max,2.4万亿参数混合专家多模态大模型,在OSWorld-Verified等智能体计算基准中超越GPT-5.6 Sol Max与Fable 5,并承诺下周开源权重;其长周期任务执行能力、计算机使用能力和经济性定价引发企业级智能体部署新讨论。

开源模型
开源模型
开源模型

Thinking Machines 发布 Inkling-Small:2760 亿参数开源多模态模型,性能逼近旗舰版且仅需四分之一计算资源

Thinking Machines 推出开源多模态模型 Inkling-Small(2760 亿参数),在 Artificial Analysis 智能指数中仅比 9750 亿参数的 Inkling 低 1 分,多项编程与推理任务反超;支持文本/图像/音频输入,上下文达 100 万 token,采用 Apache 2.0 许可,需至少 4 块 B300 或 8 块 H200 GPU 部署。

多模态模型
多模态模型
多模态模型

Runway 将 AI 视频模型缺陷转化为前端功能:实时虚拟形象的工程实践

Runway 在开发实时视频模型 Runway Characters 过程中,将模型固有偏移缺陷转化为前端「优化图像质量」功能,通过图像自动居中规避问题。其工程实践强调跨职能评估数据集构建、知识蒸馏与对抗性后训练、全栈基础设施调试,以及将模型局限性产品化的思维转变。

开源模型
开源模型
开源模型

Kimi-K3 正式开源:前端代码榜第一,只是它最先被看见的能力

Moonshot AI 开源 Kimi-K3,总参数近三万亿,原生支持视觉与百万级上下文,主打长周期 Agent 能力。它已在 Frontend Code Arena 榜单登顶,并在工程深水区(GPU 编程、芯片设计 EDA)、知识工作流(PDF/网页分析、报告生成)及多模态迭代(截图反馈→代码修正)中展现持续任务能力。其 MoE 架构与 Delta Attention 等技术支撑长程推理与状态保持。

Prompt
Prompt
Prompt

你写给 AI 的"员工手册",正在让它变蠢

Anthropic 将 Claude Code 系统提示词删减 80%,性能未受影响。65,000 token 的冗长说明书被证明存在指令冲突、上下文挤占与模型判断权剥夺等问题。团队提出六大范式转变:从硬性规则转向自适应匹配、从示例教学转向接口设计、从全量前置加载转向按需调用、从重复强调转向单一信源、从手动记忆管理转向自动记忆、从 Markdown 单一引用转向多模态上下文引用。核心转向是‘上下文工程’取代‘提示工程’。

开源模型
开源模型
开源模型

Kimi K3 全量权重发布:开源权重但非完全开源,企业需审慎评估许可条款

月之暗面发布Kimi K3全量模型权重,含2.8万亿参数MoE架构、百万级上下文及多模态能力,并配套技术报告与部署工具。其许可证允许免费商用,但对年收入超2000万美元的‘模型即服务’运营方、或MAU超1亿/月收入超2000万美元的商业产品施加额外义务,包括另行签约与显著署名要求。内部使用豁免适用。

多模态模型
多模态模型
多模态模型

微软发布自研MAI系列AI模型,GPU成本最高降89%

微软发布MAI-Image-2.5-Pro与MAI-Voice-2-Flash两款自研模型,已投入Bing、PowerPoint、Dynamics 365等产品生产环境。图像模型在文本渲染等关键能力上突破,语音模型专注高吞吐低延迟场景。内部数据显示GPU成本最高降低89%,Excel中轻量编码模型MAI-Code-1-Flash经强化学习训练后性能媲美GPT-5.6。纳德拉提出‘前沿扩散’战略,强调模型可替换性与套件解耦。

多模态模型
多模态模型
多模态模型

Black Forest Labs发布多模态模型FLUX 3:支持20秒音视频生成与机器人动作预测

Black Forest Labs推出多模态模型FLUX 3,支持单提示生成最长20秒带同步音频的视频,并拓展至机器人动作预测;采用联合训练的统一架构(Self-Flow),而非拼接独立模态模型;当前仅开放早期访问,未公布定价、SLA、基准测试细节及可下载权重;开源版FLUX 3 Dev计划晚些时候发布,将覆盖视频、音频、图像与动作预测。