音频推理」共找到 2178 篇相关文章

算法论文8

紫东太初推出GMC核心集剪枝方法,少80%Token仍满血保真多模态能力

视觉Token冗余是多模态模型高效推理与落地的瓶颈,传统筛选方法有缺陷。紫东太初团队提出GMC核心集剪枝方法,具双阶段架构,优势多,实验显示其能在减少Token同时保持性能。

量子位
开源动态8

近 2w Star,隐私优先,打工人新选择!

云端AI会议工具存数据泄露风险,Meetily项目主打100%本地处理,解决隐私短板。它是开源AI会议助手,能实时转录音频、区分说话人、生成摘要,数据不离开设备,在GitHub获近2万Star。

开源先锋
产品应用8

全球第一! 中国模型登顶榜首,首个可编辑AI语音来了

中国AI语音ViiTorVoice登顶全球语音权威评测榜单Seed - TTS,首创「局部编辑」能力,解决语音无法局部编辑痛点。实测效果惊艳,还具备精准情绪控制、无参考文本克隆等能力,部分模型已开源。

新智元
产品应用7

Claude Sonnet 5:更强,但更贵,每任务成本反超Opus 4.8

Anthropic 发布的 Claude Sonnet 5 智能指数追平 GPT - 5.5,但每任务成本比 Opus 4.8 贵 15%。它在知识工作类任务表现佳,推出促销价,不过促销后成本待察。评估迁移时需算 token 消耗。

AI工程化
新闻资讯7

视频版Nano Banana来了!内置Gemini世界知识;原版香蕉出图仅需4秒

谷歌开放Gemini Omni Flash API,将多模态推理与视频生成编辑结合,有4项关键能力,也有局限。Nano Banana 2 Lite出图快且便宜。二者串联使用,图像生成与视频创作可无缝衔接。

量子位
推荐文章7

2026年了,我们还在用爱迪生试灯丝的方式评估World Model

文章围绕World model展开深度讨论,界定其概念,分析生成派、JEPA派、空间智能派三条技术路线,指出评估比LLM难,提及游戏化benchmark可能是破局点,还强调具身进展由数据驱动,Ego - View或为泛化关键。

五源资本 5Y Capital
新闻资讯8

DeepMind 创始人 Hassabis 语出惊人:百万 token 只是在贴胶带,AGI 在 2030 年

DeepMind创始人Hassabis在访谈中评估AGI进展,认为当前范式是最终架构一部分,但持续学习等问题待解决,预计2030年左右实现AGI,还探讨了Agent、蒸馏等多方面内容,并给创业者建议。

MacTalk
算法论文8

只看图片就能学会压缩Token!浙大&阿里新框架多轮VQA压缩率90%,精度不掉|CVPR 2026

多轮视觉问答成LVLM推理效率“照妖镜”,现有压缩方法在多轮场景翻车。浙大宋明黎教授团队与阿里联合提出MetaCompress框架,可根据图像生成最优压缩映射,实验验证其效果优,能平衡压缩率与精度。

量子位
产品应用8

豆包 Seed 2.0 Lite升级:给 Agent 装上眼睛和耳朵

近期模型发布竞争激烈,作者做视频字幕常遇识别错误,因语音识别工具缺上下文。字节方舟的豆包 Seed 2.0 Lite 升级后能听,还可结合上下文准确输出字幕,成本降 20%,也能理解视频,为工作流补全感知。

花叔
新闻资讯8

两小时激辩:黄仁勋为什么不怕 TPU、不怕华为、不怕出口管制?

黄仁勋接受长达两小时专访,谈及Nvidia使命、经营哲学等多方面。他认为能源政策制约未来,CUDA优势在于生态等,还谈了对TPU、出口管制等看法,不过其观点存在矛盾待检验。

宝玉AI