视频驱动」共找到 1545 篇相关文章

新闻资讯8

陈天桥旗下AI公司MiroMind打造全球顶尖预测型大模型,性能登顶行业基准

全球首个动态实时LLM智能体未来预测基准FutureX推出,陈天桥旗下MiroMind团队连续两周蝉联冠军。其模型采用记忆驱动机制,为预测与决策设计,还展现了在多领域的预测能力,且将开放相关框架和模型。

机器之心
产品应用7

AI低质代码泛滥、API经济盛行,老牌科技厂商 F5 如何应对大模型应用“后遗症”?

F5亚太区CTO Mohan Veloo指出AI编程工具带来安全、低质代码、‘黑盒子’等问题。F5调查显示企业业务AI驱动下,安全成挑战。F5推出ADSP平台应对,还发布AI Gateway、AI助手等产品。

AI前线
产品应用8

拿下3D生成行业新标杆!昆仑万维Matrix-3D新模型鲨疯了,一张图建模游戏场景

昆仑万维推出3D世界生成框架Matrix - 3D,能从单图像生成高质量、轨迹一致的全景视频并还原可漫游3D空间。它优势明显,还突破多项技术难题,背后是昆仑万维对空间智能的战略布局。

量子位
算法论文8

AI自动写学术综述:10分钟生成6万字,成本不到四块钱

上海人工智能实验室等单位提出SurveyForge框架,能自动化生成高质量学术综述论文。它有双数据库协同驱动的大纲生成机制、学者导航代理SANA和并行生成与协调机制。还有SurveyBench评估框架,实验显示其效果好,应用前景广。

量子位
产品应用7

谷歌Veo 3玩法大升级!“360°”关键词解锁3D效果,Fast版同分辨率价格暴降5倍

谷歌旗舰视频模型Veo 3玩法再升级,添加“360°”提示词可解锁3D环绕效果。其Fast版速度更快、价格更便宜,同分辨率下价格暴降5倍,虽面部细节和光照表现有下降,但解决了部分问题。

量子位
产品应用7

SQL玩转多模态AI,轻松搞定图片+文本混合搜索

在AI驱动智能商业时代,传统搜索系统难满足需求,AI检索系统又面临数据搬运和工具链割裂难题。本文提出用原生SQL实现多模态智能检索,基于PolarDB融合AI引擎,通过SQL调用服务,无需迁移数据与搭建独立服务。

阿里云开发者
算法论文8

75页哈工大多模态推理大模型最新综述:感知、推理、思考与规划

哈工大提出75页多模态推理大模型综述,围绕四阶段发展路线图展开,即感知驱动的模块化推理、以语言为中心的短推理、以语言为中心的长推理、迈向原生多模态推理模型,还给出挑战性基准测试和实验案例见解。

PaperAgent
算法论文8

TACL 综述 | 别只卷架构了——长文本模型的能力天花板,其实是数据决定的

该 TACL 综述首次从数据视角审视长上下文语言模型,指出长上下文能力本质是数据驱动。它建立分类体系,明确高质量长文数据条件,给出核心能力的数据配方与评估法,还整理数据集和基准,提出待解问题。

深度学习自然语言处理
算法论文8

ICML 2026 Oral | 为3D空间智能数据构建全自动数据飞轮,Holi-Spatial打造400万级空间多模态数据集

来自多机构的研究团队提出 Holi - Spatial,可从原始视频自动生成 3D 重建等数据,构建 400 万级空间标注数据集 Holi - Spatial - 4M,提升 VLM 空间能力,还形成自动化数据飞轮,但存在计算成本高、特定场景表现不佳等局限。

机器之心
新闻资讯8

模型越强,人的判断力越值钱:微软CEO破解“AI替代”焦虑

微软CEO纳德拉长文探讨‘AI驱动的经济中企业的未来’,指出企业要构建AI学习闭环,让人力资本和AI能力叠加增长。还提出认知闭环概念,强调人的判断力在AI时代更有价值,给出构建学习系统的具体方法。

AIGC开放社区