相关文章
483 篇高质量内容Qwen-VLA:迈向通用具身智能的统一动作框架
从“各司其职”到“一脑多用”,通义实验室的Qwen-VLA让机器人真正拥有了统一行动的大脑,迈向通用具身智能。 核心内容: 1. 打破传统模型割裂现状,提出统一动作轨迹预测框架 2. 通过本体感知提示条件化,实现跨11种机器人平台的通用控制 3. 结合Qwen3.5-4B与DiT解码器,构建视觉-语言-动作统一模型
罗福莉说的“伪多Agent”,我试了OmniWork后发现,真全干专家长这样
OmniWork如何解决多Agent系统的常见痛点,实现真正的“全干专家”? 核心内容: 1. 剖析市面多Agent系统“伪智能”的三大核心问题 2. 对比sub-agent与team-agent架构的适用场景与选择标准 3. 展示OmniWork从零生成品牌短片的丝滑全流程实践
PDF解析折腾半年,最后靠这套方案搞定了
想用AI分析PDF却总被格式问题困扰?别急,这套整合方案帮你搞定复杂版式、表格和公式的精准解析。 核心内容: 1. PDF解析的三大主流方案(DeepSeek-OCR、PaddleOCR-VL、MinerU)的适用场景与优劣对比 2. 利用vLLM框架进行推理加速,实现高效本地部署 3. 解析输出的结构化数据(Markdown/JSON)如何无缝接入AI工作流
一个神奇的视频生成 Skills,实测,狂喜
用HTML代码直接生成视频?HyperFrames让AI agent轻松实现视频创作自动化! 核心内容: 1. HyperFrames技术原理:基于HTML+headless Chrome的创新视频生成方案 2. AI agent集成:通过skills系统让Claude等AI掌握视频制作能力 3. 完整工作流:从文字到带字幕、配音的成品视频全自动生成
你的一人公司品牌部,带着Image-2模型的lovart中文版来了
AI设计神器星流Image-2上线,国内用户也能轻松玩转创意设计! 核心内容: 1. 星流Image-2作为Lovart中文版的功能实测体验 2. 用AI进行个人形象分析的趣味案例解析 3. 如何将AI设计工具融入PPT制作等创意工作流
MNN-Sana-Edit-V2:端侧运行的图像漫画风编辑大模型
手机端15秒完成漫画风转换!淘宝联合高校研发的MNN-Sana-Edit-V2模型,兼顾隐私与效率,比云端方案快2.5倍。 核心内容: 1. 模型架构与核心技术解析 2. 端侧部署优化与性能表现 3. 实际应用场景与开源信息
刚刚!Codex 居然能直接画图了,OpenAI 凌晨甩出 Image 2.0
OpenAI 再次突破想象,Codex 不仅能写代码还能直接生成专业架构图,开发效率再上新台阶! 核心内容: 1. Codex 原生集成 Images 2.0 实现代码与绘图无缝衔接 2. 中文渲染和架构图专业度大幅提升的突破性表现 3. Images 2.0 在分辨率、知识更新和细节控制上的技术升级
PaddleOCR 3.5 发布:Web 端直用、文档一键转 Markdown,生态交互新体验
PaddleOCR 3.5带来浏览器端OCR新体验,文档转换更智能,生态融合更便捷。 核心内容: 1. 发布PaddleOCR.js,支持浏览器端轻量调用OCR能力 2. 新增文档转换功能,支持Word/Excel/PPT转Markdown 3. 融入Hugging Face生态,统一推理引擎配置方式
用Claude Code剪视频,自动去口癖、加字幕、调色,完全免费开源
告别繁琐剪辑!这款开源工具用Claude Code对话就能自动完成专业级视频处理,从去口癖到调色一气呵成。 核心内容: 1. 开源工具video-use的核心功能:自动剪辑/调色/字幕/动画叠加 2. 创新技术架构:LLM通过音频转录实现精确到单词的智能剪辑 3. 三步极简使用流程:克隆安装→配置API→对话生成成品视频
刚刚,李飞飞最新成果发布,手机也能跑亿级粒子的 3D 世界了|附体验地址
李飞飞团队最新突破:用浏览器就能体验上亿粒子的3D世界,彻底打破设备限制! 核心内容: 1. Spark 2.0如何实现亿级粒子3D场景在手机端流畅运行 2. 3D高斯点云技术原理及其突破性优势 3. 开源渲染引擎的技术架构与创新设计
豆包「打电话」升级 Seeduplex:周围再吵,只认准你的声音
豆包全新语音模型Seeduplex上线,嘈杂环境中也能精准识别你的声音,让对话如面对面般自然流畅。 核心内容: 1. Seeduplex全双工语音模型的突破性技术 2. 在公园嘈杂环境下的实际使用体验 3. 与传统半双工语音AI的对比优势
美团发布原生多模态 LongCat-Next:当视觉和语音成为AI的母语
美团LongCat-Next突破性实现多模态统一建模,让AI真正拥有物理世界的"母语"。 核心内容: 1. 传统多模态模型的局限性分析 2. DiNA架构实现视觉、语音、文本的统一离散化表示 3. 原生自回归建模带来的三大根本性改变
全解读|智谱 GLM-5V-Turbo 发布,多模态 Coding 基模
智谱 GLM-5V-Turbo 重磅升级,原生视觉能力让AI看懂设计稿直接生成代码,多模态编程新时代来临! 核心内容: 1. GLM-5V-Turbo 的核心升级:原生视觉理解与多模态编程能力 2. 在多项多模态基准测试中超越竞品,同时保持纯文本编程能力不退化 3. 典型应用场景:设计稿转代码、网页界面生成等开发效率革命
GLM-5V-Turbo:多模态Coding,图像即代码
GLM-5V-Turbo突破多模态编程边界,让AI真正看懂画面写出代码,开启视觉编程新时代。 核心内容: 1. 原生多模态Coding基座能力解析 2. 在视觉编程与纯文本场景的双重优势 3. 与行业Agent的深度协同应用案例
突破零样本TTS音色克隆上限:LongCat-AudioDiT 的声音克隆艺术
美团LongCat团队突破传统TTS技术瓶颈,推出直接生成波形的LongCat-AudioDiT模型,实现零样本音色克隆的SOTA性能。 核心内容: 1. 传统TTS系统的多阶段流程缺陷与误差累积问题 2. LongCat-AudioDiT在波形潜空间直接建模的创新架构 3. 关键技术创新:训练-推理匹配优化与自适应投影引导方法
千人千面,精控调色,更懂你的Wan2.7-Image来了
告别千篇一律的AI脸,Wan2.7-Image带你玩转个性化虚拟形象与精准色彩控制! 核心内容: 1. 千人千面:全方位定制虚拟角色五官细节,告别标准AI脸 2. 调色盘功能:支持大师级配色方案提取与自定义色彩调控 3. 超强生产力:3K token长文本渲染、12张组图生成及交互式编辑
震惊!即梦推出 CLI,Agent 一行命令生成 Seedance 2.0 视频,AI 视频井喷
即梦CLI工具震撼发布,一行命令让Agent轻松调用Seedance 2.0视频生成能力,AI创作效率迎来革命性提升! 核心内容: 1. 即梦CLI工具的一键安装与八大生成命令详解 2. Seedance 2.0旗舰模式通过CLI实现Agent批量调用 3. 高级会员限时体验政策及实战应用案例分享
千问发布Qwen3.5-Omni全模态模型,超越Gemini3.1 Pro?附实测~
千问Qwen3.5-Omni全模态模型实测表现惊艳,在中文视频理解和长音频处理上超越Gemini3.1 Pro! 核心内容: 1. Qwen3.5-Omni在剑来PV解析中的细致表现 2. 超长播客内容快速解析的实用案例 3. 新增联网配置带来的效果提升
让“龙虾”帮你自动赚钱!OpenClaw Seedance 2.0 视频生成全攻略
用"龙虾"工具一键生成Seedance 2.0视频,轻松实现自动化创作,解放你的生产力! 核心内容: 1. OpenClaw工具实现Seedance 2.0视频自动生成的全流程 2. 从文生视频到图生视频的实战操作指南 3. 常见问题解决方案与性能优化技巧
通用语音识别模型VibeVoice ASR:长达60分钟音频一次性“直出”结构化转写
微软亚洲研究院发布VibeVoice ASR,突破传统语音识别局限,60分钟长音频一键转写,结构化输出更智能。 核心内容: 1. 传统语音识别痛点与VibeVoice ASR的创新突破 2. 模型五大核心能力:长音频处理/结构化输出/热词支持等 3. 开发者友好:Hugging Face集成与多平台部署方案






