音视频智能」共找到 4259 篇相关文章

开源动态8

蚂蚁深夜开源比肩Genie 3的世界模型,我也看到了具身智能的未来。

蚂蚁旗下灵波科技凌晨开源世界模型LingBot-World,可对标Google Genie 3。它能实时交互生成世界,与视频生成模型不同。有三个版本,具备长时记忆稳定、风格泛化性强、动作代理出色等特点。

数字生命卡兹克
新闻资讯7

浙大系具身智能再闯港交所:主打工业场景,每天进账1000000元

仙工智能再次冲刺港交所,此前5月首次递表未实质进展。过去三年营收走高,2024年达3.39亿,但连续三年亏损累计1.22亿。其聚焦工业场景,提供机器人控制系统等一站式方案,产品涵盖控制器、软件等。

量子位
算法论文8

HyperEyes:从「搜得更深」到「搜得更宽」,并行多模态搜索智能体的效率革命

小红书研究团队提出 HyperEyes 模型,打破现有多模态搜索智能体串行处理模式困局。通过全栈设计实现并行多模态搜索范式跃迁,在多基准测试中表现优异,证明准确率与效率可协同进化。

机器之心
新闻资讯7

具身智能迎来“安卓时刻”,一位清华博士决定给机器人换脑|甲子光年

千诀科技CEO高海川讲述其打造的具身智能系统,可脱离特定硬件载体,安装到不同机器人。公司跳出端到端VLA束缚,选分区预测式世界模型,目标是打造“机器人领域的安卓系统”,还认为家庭场景比工业场景易落地。

甲子光年
产品应用7

AI陪伴Top 1应用上线视频生成!图片人物能说话唱歌,多轮对话场景依然稳定

AI陪伴应用Top 1的Character.ai(c.ai)上线视频生成功能AvatarFX,可让静态图片人物“开口说话”。c.ai还上新多项AI创作功能。此外,谷歌收购c.ai遭美国反垄断调查。

量子位
算法论文8

ICLR 2026 | LongHorizonUI:让 GUI 智能体不再"半途而废"——面向长链路任务的统一鲁棒自动化框架

近年来,基于多模态大语言模型的GUI智能体在自动化操作上虽有进展,但任务步数超10 - 15步时成功率断崖下跌。研究人员提出LongHorizonUI框架,构建LongGUIBench评测基准,推动GUI自动化在复杂场景落地。

机器之心
算法论文8

挑战Claude4的8B Agent!NUS提出AgenTracer:面向多智能体系统的失败归因

随着大语言模型发展,多智能体系统潜力大但失败率高。新加坡国立大学等机构研究者提出AgenTracer框架,构建标注管线、设计轻量级追踪器,在失败归因任务上超大型闭源模型,还能助力系统自我提升。

深度学习自然语言处理
算法论文8

挑战Claude4的8B Agent!NUS提出AgenTracer:面向多智能体系统的失败归因

随着大语言模型发展,多智能体系统潜力大但有系统脆弱性问题。NUS研究者在论文中提出AgenTracer框架,构建标注管线,设计AgenTracer - 8B模型,在失败归因任务上超大型闭源模型,还能助力系统自我提升。

PaperAgent
开源动态8

消费级显卡可以快速上手跑!面壁智能MiniCPM-o 4.5发技术报告

面壁智能联合多方发布MiniCPM-o 4.5技术报告。该模型是业界首个端到端全双工全模态大模型,参数约9B,依托Omni - Flow框架,多项性能对标前沿大模型,还推出多种使用方式,兼顾普通用户与开发者需求。

量子位
新闻资讯7

AI狂飙100天,中国力量突起!顶流视频号10分钟看尽全球最强杀招

2025年开年,全球AI版图重绘,从中国DeepSeek开源风暴到OpenAI闭源反击,双方在算力、模型等层面激烈碰撞。各月双方均有新动作,4月AI迈入全民普及,新智元联合视频号推出活动助掌握科技风向。

新智元