「音视频实时交互模型」共找到 1736 篇相关文章
大小模型协同架构在金融智能投顾中的应用与挑战
本文整理自北银金科高级算法专家尹辰轩分享,介绍大小模型协同架构下的大模型投顾方案,能解决幻觉问题、优化回答深度。还提到 12 月 19 - 20 日 AICon 北京站聚焦多热门方向。
微软开源智能呼叫中心,完全替代人工客服
微软开源基于Azure和OpenAI GPT的智能呼叫中心解决方案,可完全替代人工客服。它功能强大,支持多语言、实时流式对话等,还能定制。文章详细介绍了部署步骤、高级用法等内容。
大模型公司不搞浏览器搞Agent,实测找到原因了
文章实测阶跃星辰桌面Agent小跃,它能操作命令行,可自然语言驱动计算机功能,有悬浮球形态,能联网、搜索、处理表格等,还支持复用操作、定时任务,但也存在速度慢等不足。
论文秒变PPT!西湖大学AGI Lab推出Auto-Slides,科研汇报难度骤降
西湖大学AGI Lab推出Auto - Slides,输入论文PDF可自动生成演示文稿,支持自然语言交互修改。它采用多智能体协作框架,经实验验证优势明显,有望用于学术会议等场景,助力知识传递。
苹果AI选Mamba:Agent任务比Transformer更好
苹果新研究指出,在长任务、多交互的Agent式任务中,基于SSM架构的Mamba在效率与泛化能力上超Transformer。虽Mamba有局限性,但引入外部工具后性能显著提升。
AI时代,MrBeast和影视飓风教我的事:最好的内容都是无用的
文章借罗永浩与影视飓风Tim对谈引出话题,以MrBeast、迪士尼为例,阐述最好的内容无用,其价值在于创造体验、建立信任、打造IP。还指出AI时代,无用内容因不可替代更具商业价值。
ICLR神秘论文曝光!SAM3用「概念」看世界,重构视觉AI新范式
2023年Meta推出SAM,后SAM 2扩展到视频分割。近日,SAM 3现身ICLR 2026盲审论文,带来「基于概念的分割」新范式,强调按「语义概念」理解和分割图像,还构建数据引擎提升性能。
Mamba-3惊现AI顶会ICLR 2026!CMU知名华人教授一作首代工作AI圈爆红
Transformer有力挑战者Mamba的最新版本Mamba-3进入ICLR 2026盲审。它有三大改进,在长文本处理、实时推理和成本优化有优势。此外,FBAM也从不同角度探索Transformer下一代框架。
通义团队提出环境Scaling:自动构建环境,并自主学习和成长,可让30B比肩1T效果
阿里巴巴通义实验室团队论文提出通过程序化、自动化构建模拟环境,让语言模型自主交互学习。基于此训练的AgentScaler模型,数十亿参数就达万亿级模型性能,为轻量级代理智能发展带来新可能。
一致性对标Nano Banana,国产Vidu Q1同时支持7张参考 | 实测
AI生图赛道竞争激烈,专注视频大模型的Vidu推出Q1参考生图模型,能同时支持7张参考图,主体一致性对标谷歌Nano Banana。实测玩法多样,有高可操作性,现已全球同步上线。