视频生成业务」共找到 3191 篇相关文章

算法论文7

Qwen负责人转发2025宝藏论文,年底重读「视觉领域GPT时刻」

2025年末,Qwen大模型技术负责人林俊旸转发谷歌DeepMind入选ICCV 2025的论文,指出视觉领域“GPT时刻”要来了。研究用实验数据证明,视频模型正跳出任务专属局限,实现一个模型完成多视觉任务,推理过程还能被CoF“演”出来。

量子位
推荐文章8

国内第一视角数据最早押注者,北大卢宗青:隐空间才是具身的路

北大卢宗青是国内第一视角数据最早押注者和隐空间路线推进者。他认为人类视频是具身智能唯一可规模化的数据路径,创立BeingBeyond走隐空间世界动作模型路线,成本低、推理快,还发布全球首个隐式触觉世界动作模型Being - H0.8。

AI科技评论
产品应用7

数据合成篇|多轮ToolUse数据合成打造更可靠的AI导购助手

文章以租赁导购助理“小不懂”为例,介绍Tool Use训练数据合成方案。先分析训练数据的目标与难点,提出动态多智能体对话生成框架,阐述多轮数据、复杂问题合成及过滤方案,展示数据和模型效果,还提及未来工作方向。

阿里云开发者
新闻资讯7

误入人均10个顶级offer的技术天团活动,顶尖AI人才的选择逻辑我悟了

作者参加京东TGT计划活动,与两位入职京东的顶尖AI人才交流。Daniel因京东重视生成式推荐项目、技术氛围纯粹而选择它;Kyrie则被创业热情、技术理想共鸣及数据优势吸引。入职后两人都获核心项目机会。

量子位
算法论文8

ICML 2026 Oral | 为3D空间智能数据构建全自动数据飞轮,Holi-Spatial打造400万级空间多模态数据集

来自多机构的研究团队提出 Holi - Spatial,可从原始视频自动生成 3D 重建等数据,构建 400 万级空间标注数据集 Holi - Spatial - 4M,提升 VLM 空间能力,还形成自动化数据飞轮,但存在计算成本高、特定场景表现不佳等局限。

机器之心
产品应用7

00后下场整顿Agent:啥都不学就能用好AI,这才是正确打开方式

AI圈模型变强但使用门槛变高,00后团队打造的胖鹅AI以低提示词为卖点,实测在生成视频、数据看板网页等方面表现出色。其核心是SOP体系,让AI适应人的习惯,降低使用门槛。

量子位
推荐文章7

我们就这样在一起搞了两年

作者2024年离开特赛发后创业,用积蓄和炒股所得作为本钱。项目避开大语言模型和视频生成,选教育领域做考研调剂志愿填报,用agent完成工作。产品销售不错,作者虽有心理波动但坚持,未来想尝试新领域。

Agent的潜意识
算法论文8

无需验证器的RL:RLPR解锁LLM通用推理潜能

现有依赖强化学习与可验证奖励(RLVR)提升大语言模型(LLM)推理能力的方法,受限于领域特定验证器。本文提出RLPR框架,利用LLM生成正确答案的固有概率作奖励信号,实现无需外部验证器的通用领域强化学习,效果显著。

深度学习自然语言处理
新闻资讯7

今晚直播|从《黑客帝国》到迪士尼乐园:谈《拟像与拟真》

法国后现代思想大师让·波德里亚在《拟像与拟真》中预警数字时代图景。2025年12月5日19:30 - 21:30,豆瓣读书等邀多位学者结合电影探讨波德里亚思想及拟像概念,直播将在豆瓣读书视频号同步。

豆瓣读书
推荐文章8

多模态大语言模型的核心技术架构与训练方法的进化

文章深入剖析多模态大语言模型核心技术架构与训练方法的进化,涵盖建模范式、视觉编码器、语言骨干网络、模态对齐、生成范式及训练方法等方面,介绍其演进路径与代表模型,还提及国内模型创新及开源模型OpenVLA。

AIGC开放社区