美图旗下RoboNeo接入MiniMax H3,支持局部编辑、多模态理解
美图RoboNeo接入MiniMax H3,多模态理解加持,局部编辑能力再升级!
36氪获悉,美图旗下RoboNeo宣布正式接入MiniMax H3,进一步强化多模态理解能力,可理解文字、图片、视频及音频等多种输入形式。同时支持更加精细化的视频局部编辑,包括人物替换、物体增减、背景修改、特效调整、音色迁移以及台词修改等操作。
美图RoboNeo接入MiniMax H3,多模态理解加持,局部编辑能力再升级!
36氪获悉,美图旗下RoboNeo宣布正式接入MiniMax H3,进一步强化多模态理解能力,可理解文字、图片、视频及音频等多种输入形式。同时支持更加精细化的视频局部编辑,包括人物替换、物体增减、背景修改、特效调整、音色迁移以及台词修改等操作。
视频多模态推理新基准MMR-V,挑战模型理解“未言说”的深层语义。
arXiv:2506.04141v2 Announce Type: replace-cross Abstract: The sequential structure of videos poses a challenge to the ability of multimodal large lang…
字节发布新一代大模型Seed 2.1,三大能力全面升级,Pro和Turbo版本深度思考对标GPT-5.5。
IT之家 6 月 23 日消息,据IT之家小伙伴反馈,字节跳动悄悄在火山引擎官网上线了 豆包 Seed 2.1 系列模型 ,包括 Pro 和 Turbo 版本,Seed-Evolving 模型也进行了迭代。 根据官方介绍,Doubao-Seed-2.1 是面向 Coding 和 Agent 时代打造…
ICML 2026新研究揭示:音频大模型可能只会“读”文本,而非真正“听”懂副语言信息,VoxParadox框架提供诊断与解决方案。
arXiv:2605.27772v1 Announce Type: cross Abstract: Audio large language models (Audio LLMs) demonstrate strong performance on speech understanding task…
统一多模态理解与生成框架,唤醒空间智能,为AI视觉注入全新维度。
arXiv:2605.04128v2 Announce Type: replace-cross Abstract: We present JoyAI-Image, a unified multimodal foundation model for visual understanding, text…