识别、合成、实时交互全球第一,Qwen-Audio-3.0 系列语音模型上线阿里千问 AI 平台
全球语音AI评测三项第一,阿里Qwen-Audio-3.0正式上线,识别、合成、实时交互全线领先,语音大模型迈入新台阶。
IT之家 8 月 17 日消息,今天(17 日)下午,阿里云通过公众号宣布,Qwen-Audio-3.0 系列语音模型正式上线千问 AI 平台和阿里云百炼平台。 开发者可以通过 API 服务调用模型能力,也可以订阅 Token Plan 使用 。 Qwen-Audio-3.0 系列模型是阿里巴巴推出…
字节跳动 SeedRealtime 音视频全双工大模型发布:支持边看、边听、边说,已上线豆包
字节发布SeedRealtime音视频全双工大模型,统一架构原生融合音视频文本,已在豆包上线,边看边听边说还能打视频电话。
IT之家 8 月 5 日消息,字节跳动 Seed 今日宣布推出 原生音视频全双工大模型 SeedRealtime , 走向全模态自然交互。 SeedRealtime 用统一架构原生融合音频、视频与文本,能在连续的多模态信息流上实时交互,带来“边看、边听、边说”的全新体验。它实现了以下三项核心突破: …
Smallest.ai raises $13M to build ultra-fast voice AI that sounds genuinely human
Smallest.ai获投1300万美元,押注小语音模型+离线大模型双架构,打造几乎以假乱真的实时语音交互。
The startup is building voice models designed to make AI phone calls pass the Turing test.
阿里开放式世界模型快乐生蚝 HappyOyster 1.0 登陆百炼平台,支持两大核心模式
阿里开放式世界模型HappyOyster,能根据输入创建任意角色和世界,支持1分钟以上音画同步交互,两大核心模式助力探索与导演。
IT之家 7 月 19 日消息,阿里巴巴今天宣布,开放式世界模型 HappyOyster 1.0(快乐生蚝)现已登陆阿里云百炼,面向企业和开发者开启灰测。 IT之家了解到,HappyOyster 1.0 版本围绕「用户与世界的关系」,提供世界探索(Adventure)与实时导演(Directing)…
高德发布通用世界模型工坊ABot-World Studio:5090单卡可生成小时级实时交互式视频与3D场景
高德最新世界模型工坊可单卡生成小时级实时交互视频与3D场景,首创“时空任意门”实现全尺度空间无缝穿梭。
无限世界、实时交互,蚂蚁灵波开源 LingBot-World 2.0 世界模型
蚂蚁灵波开源世界模型,支持小时级无限生成与多人实时共探,具身智能新突破
IT之家 7 月 9 日消息,今天,蚂蚁灵波正式开源全新一代实时交互世界模型 ——LingBot-World 2.0(又称 LingBot-World-Infinity)。 据官方介绍,LingBot-World 2.0 全面升级了世界预测与交互能力 —— 支持更多动作与事件,解锁多样化交互玩法与模…
支持实时视频通话和语音控制视频走向,生数科技发布 Vidu S1 实时交互模型
IT之家 7 月 3 日消息,生数科技今日发布面向实时交互场景的新一代模型 ——Vidu S1 实时交互模型。 官方表示,Vidu S1 模型 支持实时视频通话和语音控制视频走向 ,用户不仅能通过语音控制数字人的行为,还能实现无限时长连续互动。 Vidu S1 支持 540P (960x540)高清…
生数科技正式发布Vidu S1实时交互模型
36氪获悉,生数科技正式发布Vidu S1实时交互模型,提供实时可交互的新一代视频生成能力,模型支持实时视频通话和语音控制视频走向。同时,Vidu S1支持540P(960x540)高清分辨率、25FPS帧率(最高支持42FPS),可基于真人、动漫、萌宠等任意初始形象及个性化音色,快速创建专属交互角…
Co-policy: Responsive Human-Robot Co-Creation for Musical Performances
机器人如何与人类即兴协作,共创动人音乐演出?这项研究提出Co-policy策略,让人机实时响应、共同创作,打开AI艺术新可能。
arXiv:2606.19914v1 Announce Type: cross Abstract: Art has long stood as a pivotal expression of human creativity. Embodied artificial intelligence off…
阿里发布世界模型 HappyOyster 快乐生蚝 1.0:一句话生成可实时交互的数字世界
一句话生成实时交互数字世界,阿里云推出「快乐生蚝」1.0,支持与虚拟男友动态互动,颠覆传统AI生成流程。
IT之家 6 月 17 日消息,阿里云今晚宣布推出可实时构建和交互的开放式世界模型产品 HappyOyster 1.0(快乐生蚝 1.0)。一句话,即可生成一个完整、可演绎、可探索、可互动的数字世界。 据介绍,该产品深度学习物理世界状态转移规律,能主动推演从动作到反馈的因果链,并保持人物和环境的长程…
Liberating LLM Capabilities in Full-Duplex Speech Models
探索如何释放大语言模型在全双工语音中的潜能,突破实时语音交互新边界。
arXiv:2606.07547v1 Announce Type: new Abstract: Speech-based large language models are typically constrained to spoken replies, which limits their use…
Parloa builds service agents customers want to talk to
Parloa借助OpenAI模型打造可扩展的语音AI客服代理,让企业轻松设计、模拟并部署可靠实时交互。
Parloa leverages OpenAI models to power scalable, voice-driven AI customer service agents, enabling enterprises to design, simulate, and deploy reliab…