「实时语音推理」共找到 2562 篇相关文章
OpenAI博通联手发芯片,黄仁勋还能保持松弛吗?
OpenAI与博通联手发布自研推理芯片Jalapeño,英伟达虽业绩亮眼但正被围攻。博通的ASIC芯片及通信优势、中立身份受青睐,OpenAI和Anthropic也正脱离英伟达管控,博通靠“芯片自主权外包”模式上位。
豆包 Seed 2.0 Lite升级:给 Agent 装上眼睛和耳朵
近期模型发布竞争激烈,作者做视频字幕常遇识别错误,因语音识别工具缺上下文。字节方舟的豆包 Seed 2.0 Lite 升级后能听,还可结合上下文准确输出字幕,成本降 20%,也能理解视频,为工作流补全感知。
DeepSeek刚解决了AI视觉最后一块拼图:极低成本+精准视觉定位,AI接管电脑已无死角
DeepSeek放出新论文《Thinking with Visual Primitives》,解决多模态大模型中长期被忽视的“说不清位置”问题。提出将空间标记作为“最小思维单元”插入推理链条的方案,在多个任务上达前沿水平,但也存在精度、触发机制和泛化能力等局限。
Meta 143亿挖角后首个作品来了:Alexandr Wang 推出闭源模型,杨立坤点赞
沉寂9个月后,Alexandr Wang带队的Meta发布新一代模型Muse Spark。它是原生多模态推理模型,性能媲美Gemini Pro和GPT 5.4,Meta还披露技术实现细节。不过闭源引争议,且模型在长时程智能体等方面有短板。
还在玩AI 3D手办?Gemini 3 Deep Think已能直出STL,可打印实物
推理模型赛道竞争激烈,谷歌 Gemini 3 Deep Think 迎来重大升级,能处理科研级、工程级、多条件约束问题,可将用户要求等建模成 3D 打印实体文件,还能用于多领域科研和工程,欲成科研工程‘第二大脑’。
AI能帮忙厨房看火了!面壁智能开源全模态模型MiniCPM-o4.5,边看边听还能主动抢答
面壁智能开源全模态模型MiniCPM-o4.5,能边看边听还主动抢答。它引入全双工多模态实时流机制,在多方向达全模态模型领先水平。该模型是端侧原生,将与开发板配套,助力端侧智能硬件开发。
腾讯AI战略大升级:组织架构重组与混元世界模型1.5发布
2025年12月17日,腾讯宣布两项重大举措,一是重组AI组织架构,成立新部门并任命首席AI科学家;二是发布混元世界模型1.5,能实时生成可交互3D虚拟世界,应用场景广泛,或引领行业进入‘AI原生’新阶段。
通往通用人工智能的关键一步?DeepMind放大招,3D世界最强AI智能体SIMA 2
Google DeepMind发布SIMA 2,这是能在虚拟3D世界自主游戏、推理和学习的通用AI智能体。它集成Gemini模型,从指令跟随到主动认知跃进,泛化性能提升,还具备自我提升能力,为AI和机器人技术发展提供新路径。
老黄亲自站台,英伟达编程神器!Cursor 2.0自研模型狂飙4倍
Cursor 2.0版本重大升级,发布自研编码模型Composer,速度是同等模型4倍。还重构IDE交互逻辑,支持多智能体模式,引入语音模式等。早期测试和开发者反馈其速度快,但智能程度与部分模型有差距。
AI在线强化学习“边做边学”,斯坦福团队让7B小模型性能飙升,甚至超越GPT-4o
斯坦福等团队提出新范式AgentFlow,由四个智能体组成,用在线强化学习持续提升智能体系统推理能力。以Qwen - 2.5 - 7B - Instruct为基座模型的它在多基准测试表现突出,甚至超越GPT - 4o等大模型。