JOTO
联系我们
← AI 智库
模型与技术专题

多模态模型

整理多模态模型相关的技术判断、实施方法与企业级实践,重点关注可部署性、安全性和业务价值。

相关文章

483 篇高质量内容
多模态模型
多模态模型
多模态模型

统一多模态Embedding, 通义实验室开源GME系列模型

这是通义实验室解决多模态检索难题的创新成果,不容错过! 核心内容: 1. 多模态检索的背景与挑战 2. GME 统一多模态表征的特点 3. 模型的训练数据与评测方式

多模态模型
多模态模型
多模态模型

智谱发布新模型,“实时多模态”惊艳所有人

智谱新模型发布,多模态能力惊艳!行业首个端到端模型,为开发者送福利。 核心内容: 1. 介绍端到端多模态模型的创新能力 2. 阐述模型的免费调用及相关代码 3. 展示模型的语音对话和唱歌功能

多模态模型
多模态模型
多模态模型

阶跃星辰Step-1o重大升级,多模态视觉双榜夺冠,国内第一!

国内首个千亿参数端到端语音大模型 Step-1o 系列重大升级,多模态视觉双榜夺冠,这是小贤看到的关于模型升级最好的消息,没有之一。 核心内容: 1. Step-1o 系列模型上新动态 2. Step-1o Vision 多模态理解大模型的优势 3. 两款模型的使用入口及获取成绩

多模态模型
多模态模型
多模态模型

Kimi 发布k1.5思考模型:首个达到o1满血水平的多模态模型,还有完整训练技术报告

Kimi 发布超强 k1.5 多模态模型,性能卓越,训练技术公开,这是小贤看到的关于此模型最好的介绍,没有之一。 核心内容: 1. Kimi k1.5 模型的重磅升级历程 2. 与全球最强模型的性能对比 3. k1.5 模型设计和训练的关键要素

多模态模型
多模态模型
多模态模型

谷歌发布Gemini2.0,开启Agent新时代

多模态模型
多模态模型
多模态模型

我构建多Agent平台的探索与愿景

多模态模型
多模态模型
多模态模型

Github揽获1.6K星!南大、腾讯发布VITA-1.5: 迈向GPT-4o级实时视频-语音交互

多模态模型
多模态模型
多模态模型

千问又放大招!720亿参数的视觉语言模型什么样?

多模态模型
多模态模型
多模态模型

2025 年10大AI 方向:高效推理、多模态等

多模态模型
多模态模型
多模态模型

利用多模态RAG实现图文并茂的内容生成

多模态模型
多模态模型
多模态模型

2025年开篇|AI Agent与多模态大模型:智能革命的新纪元

多模态模型
多模态模型
多模态模型

多模态RAG技术:从语义抽取到VLM应用与规模化挑战

多模态模型
多模态模型
多模态模型

戴上眼镜的Kimi能力超强,领先 o1 和 Gemini

多模态模型
多模态模型
多模态模型

Gemini 2.0 Flash Thinking:谷歌推出实验性多模态推理模型,在快速生成的同时展示详细的思考过程

多模态模型
多模态模型
多模态模型

GPT-4o掀起全模态热潮!一文梳理全模态大模型最新研究进展

多模态模型
多模态模型
多模态模型

初创公司 Odyssey 推出 AI 工具 Explorer了

多模态模型
多模态模型
多模态模型

利用 Gemini 构建 PDF 文档 AI 管道:原理、实现与应用(含代码)

多模态模型
多模态模型
多模态模型

百度飞桨:多模态大模型技术进展与产业应用实践

多模态模型
多模态模型
多模态模型

Kimi发布视觉思考模型k1,会看图做题,还能看图定位你在哪里

多模态模型
多模态模型
多模态模型

RAG用于翻译实现思路及多模态模型用于文档理解的几个核心问题