苹果首款 AI 眼镜有望 2027 年亮相:首代无显示屏,瞄准语音与视觉识别
IT之家 8 月 30 日消息,科技媒体 9to5Mac 昨日(8 月 29 日)报道,苹果计划最早 2027 年推出其首款 AI 智能眼镜,预估会在 2027 年全球开发者大会(WWDC27)上面向开发者公布,并在当年晚些时候出货。 发布节奏方面,该媒体梳理现有爆料信息,认为苹果公司可能会在明年 …
IT之家 8 月 30 日消息,科技媒体 9to5Mac 昨日(8 月 29 日)报道,苹果计划最早 2027 年推出其首款 AI 智能眼镜,预估会在 2027 年全球开发者大会(WWDC27)上面向开发者公布,并在当年晚些时候出货。 发布节奏方面,该媒体梳理现有爆料信息,认为苹果公司可能会在明年 …
IT之家 8 月 27 日消息,在今日的小鹏物理 AI 分享暨第二代 VLA 全新版本体验日活动中,小鹏第二代 VLA 全新版本模型能力全面增强。 据小鹏官方介绍,第二代 VLA 全新版本升级的不只是智能辅助驾驶, 小鹏选择用做机器人的方式重构车机大脑,首次推出 Master Agent ,实现 V…
针对长语音大模型KV缓存膨胀问题,提出WnW动态增减机制,让长语音推理更省显存、更流畅。
arXiv:2608.22704v1 Announce Type: new Abstract: Long-form audio inputs make the KV cache the dominant memory cost of speech LLMs. Prefill-only KV comp…
用西里尔字母谐音伪装提问,检验大模型能否破解这层“密语”并保持问答性能,脑洞与严谨兼备
arXiv:2608.21462v1 Announce Type: cross Abstract: Due to the selection of their training data, large language models (LLMs) perform best on standard-l…
把非智能的双电机升降桌,改成我梦想中的智能升降中枢。 查看全文
豆包输入法鸿蒙版尝鲜,语音大模型加持,快慢轻声都能精准识别,还支持无网使用!
IT之家 8 月 22 日消息,豆包输入法鸿蒙版现已在 App Gallery 应用商店 开启尝鲜 ,版本号为 0.9.1(901),时间为 8 月 22 日至 9 月 21 日。 官方表示,豆包输入法的「语音输入」使用豆包同款语音大模型,语音输入又快又准,支持多方言、英语及中英混输;快速说话、轻声…
坐上Waymo自动驾驶出租车,动嘴就能调温查周边,Gemini当副驾超省心
IT之家 8 月 20 日消息,谷歌的 Gemini 如今已经覆盖了越来越多的设备和服务,从智能手机、PC、耳机、智能家居产品,到 Android Auto 等平台都能看到它的身影。现在,谷歌又准备将 Gemini 扩展到生态系统的另一个领域,把它直接整合进 Waymo 即将推出的 Ojai 自动驾…
Meta推出Mac版AI应用,用语音直接操控社交应用,打造全新交互范式,抢占AI入口。
Meta said its Muse Spark model is powering the dictation feature.
针对不同语系评估大模型语音识别表现,揭示跨语言泛化差异,为多语言ASR提供新视角。
arXiv:2601.18899v3 Announce Type: replace-cross Abstract: Large Language Model (LLM)-powered Automatic Speech Recognition (ASR) systems achieve strong…
语音AI界的OpenRouter,按语言与场景智能路由多模型,不再迷信厂商榜。
Hi HN! I'm Bek, founder of Speko, a platform that finds an optimal combination of speech-to-text, LLM, and text-to-speech models, given your constrain…
语音输入创企Wispr融资2.8亿美元、估值达20亿,新模型Canto把错误率降至10%以内,正加速突破听写边界。
Wispr’s total funding is now over $361 million.
全球语音AI评测三项第一,阿里Qwen-Audio-3.0正式上线,识别、合成、实时交互全线领先,语音大模型迈入新台阶。
IT之家 8 月 17 日消息,今天(17 日)下午,阿里云通过公众号宣布,Qwen-Audio-3.0 系列语音模型正式上线千问 AI 平台和阿里云百炼平台。 开发者可以通过 API 服务调用模型能力,也可以订阅 Token Plan 使用 。 Qwen-Audio-3.0 系列模型是阿里巴巴推出…
在Claude聊天里直接创建和管理ElevenLabs语音智能体,AI语音工作流一步到位
Create and manage ElevenLabs voice agents in your chat Discussion | Link
宠物陪伴应用用主人录音安抚狗狗,但一个容易被忽略的细节:狗狗可能因此学会害怕录音本身。适合关注产品副作用的人看。
What I Built I don't own a dog. But roughly one dog in six gets genuinely distressed when it's left home alone, and while reading up for this challeng…
为印度亿万用户打造的多语言语音金融助手,看AI如何打破语言与信息壁垒
How I Built RupeeGPT: A Voice-First AI Financial Assistant for India in 10 Days #VoiceForBharat | Built with the fastest TTS API — Murf Falcon | 10 Da…
本地语音转文字加AI润色,隐私安全还免费
Article URL: https://github.com/AntoineChatry/Dictata Comments URL: https://news.ycombinator.com/item?id=49306462 Points: 3 # Comments: 0
豆包输入法iOS版新增账号登录与词库云端同步,换设备不再丢数据,语音输入更实用。
IT之家 8 月 14 日消息,豆包输入法 iOS 版 8 月 13 日正式推送 1.5.0 版本升级,IT之家附更新内容如下: 新增账号登录,词库定时云端同步,换设备也不丢数据 优化语音输入的跳转异常的问题。 豆包输入法 iOS 版于去年 11 月登录苹果 iOS 平台, 支持豆包同款语音输入 。…
IT之家 8 月 14 日消息,微软 2025 年 10 月推出 Mico,给 Copilot AI 聊天机器人的语音对话配上了一个 拟人化形象 。结果还不到一年,这个可怜的小团子就似乎被“降职”了。 据外媒 Engadget 今天(14 日)报道,微软决定把 Mico 从 Copilot 语音功能…
AI戒指厂商Sandbar断言语音将主导可穿戴未来,看Stream如何押注下一代交互变革。
AI notetaking hardware has taken off over the past couple of years, with credit-card-sized devices, pendants, pins, and even …
解决大模型全双工语音对话中“用户没听到却已生成”的错位难题,让对话更自然。
arXiv:2608.07631v1 Announce Type: cross Abstract: LLM-based full-duplex voice services allow users to speak while the assistant is responding. Because…