视频预训练」共找到 3034 篇相关文章

算法论文8

视觉感知RAG × 多模态推理 × 强化学习 = VRAG-RL

数字化时代视觉信息愈发重要,传统RAG方法处理视觉信息面临挑战。阿里巴巴通义实验室的VRAG - RL将强化学习引入多模态智能体训练,革新检索生成范式,提升视觉语言模型多方面能力,代码已开源。

PaperAgent
开源动态8

仅用图像也能Think:Google等提出一种视觉规划的全新推理范式!

剑桥和Google等提出并开源视觉规划范式,通过纯视觉表示规划,独立于文本。还引入VPRL框架,用GRPO后训练大型视觉模型。实验选三个视觉导航任务,VPRL表现最佳,显著优于其他方法。

PaperAgent
开源动态8

通义实验室新研究:大模型自己「扮演」搜索引擎,提升推理能力无需搜索API

阿里通义实验室开源ZeroSearch,提供无需与真实搜索引擎交互的强化学习框架。它用模拟搜索环境和渐进式抗噪训练,让LLM自给自足,节省API成本,在多问答数据集表现优,为智能化检索提供新思路。

量子位
新闻资讯7

一个提示攻破所有模型,OpenAI谷歌无一幸免!

HiddenLayer研究发现一种「策略傀儡」提示,将危险指令伪装成配置片段,配上角色扮演,能让ChatGPT等主流大模型开启「无限制模式」。此策略利用训练弱点,难修复且可扩展,厂商需智能监控。

新智元
新闻资讯7

4个MIT的00后,两年干出全球最火AI编程工具,600亿美元卖给了SpaceX

今年1月,Cursor CEO Michael Truell决定训练自有模型,不再依赖Anthropic的Claude。5个月后,SpaceX以600亿美元收购Cursor母公司。此前Cursor增长快但依赖Claude,自研模型有成本优势却缺算力。

DeepTech深科技
算法论文8

高潮从第几秒开始?GaMMA 让多模态大模型真正「听懂」音乐时间线

现有多模态大模型难以理解音乐时间线。复旦大学与字节跳动团队提出 GaMMA,采用双编码器融合网络,经三阶段训练,还推出 MusicBench 评测基准。实验显示,GaMMA 在多基准上表现优异,刷新 SOTA。

机器之心
开源动态7

AI短剧生成神器

作者分享开源的AI短剧生成工具,它能根据剧本完成智能分镜、生成视频片段等一条龙服务,采用全局种子+风格继承改善人物和场景一致性,有分镜编辑器可手动调控,适合多种人群。

GitHubStore
产品应用8

Qwen3-LiveTranslate:视、听、说全模态同传大模型!

Qwen3-LiveTranslate-Flash 是基于大语言模型的多语言实时音视频同传模型,依托 Qwen3-Omni 能力与海量数据,有多语言和方言支持、视觉增强等亮点,性能超主流大模型。

通义千问Qwen
开源动态8

公开模型一切,优于DeepSeek-R1,英伟达开源Llama-Nemotron家族

英伟达推出面向高效推理的 Llama-Nemotron 系列模型,包括 Nano、Super、Ultra 等规模,具备卓越推理能力与效率,采用开放许可。模型支持动态推理切换,训练结合多方法,性能优于 DeepSeek-R1 等。

机器之心
开源动态7

第六章 Coding优先编的是「过程与约束」,不是「参数」

本章以开面包店类比训练大模型,介绍 AutoResearch 自主实验框架。它将研究生助理工作循环交给 Agent,在固定时间用单一指标判断好坏。仓库获约 64.7K Stars,Karpathy 设计哲学为极简主义与固定约束。

CourseAI