长视频数据」共找到 3758 篇相关文章

开源动态8

给GUI Agent装上「世界模型」:阿里通义用混合数据+统一思维链,让模型学会预判屏幕变化

伴随多模态大模型发展,GUI Agent成人机交互新范式,但构建高可用、跨平台的GUI Agent面临诸多挑战。阿里通义实验室开源Mobile - Agent - v3.5框架及GUI - Owl - 1.5模型家族,解决了相关技术壁垒。

量子位
开源动态8

字节开源高效解析文档图像的新型多模态模型Dolphin,快速将复杂的文档图像转化为结构化数据

字节开源新型多模态模型Dolphin,采用“先分析后解析”范式,能将复杂文档图像转化为结构化数据。它有卓越性能和多种特性,还提供安装、推理使用指南。

GitHubStore
算法论文8

腾讯发布SpecExit算法,无损压缩端到端加速2.5倍!解决大模型思考效率难题

腾讯发布 SpecExit 算法,将思考早停与投机采样融合,利用轻量级草稿模型预测“退出信号”,在不引入额外探测开销的前提下,实现动态、可靠的思考早停,在 vLLM 上推理端到端加速 2.5 倍,准确性和推理效率得到双重保障。

机器之心
产品应用8

刚刚,AI视频的天花板被掀翻!测完SkyReels后飘了:我亦有成为专业导演的潜质

昆仑万维官宣上线全新一站式多模态AI视频创作平台SkyReels,同步发布模型SkyReels V3并优化多能力。实测其画布、Agent等功能玩法多,还打通多模态边界,将巩固昆仑万维地位,加速人人专业创作愿景到来。

机器之心
算法论文7

AI仅凭“自信”学会推理,浙大校友复刻DeepSeek思维链涌现,强化学习无需外部奖励信号

UC Berkeley团队提出新训练方法Intuitor,大模型无需接触真实答案,仅优化自身信心就能学会复杂推理。该方法无需外部奖励信号或标注数据,用模型自身置信程度作内在奖励信号,在多任务表现良好。

量子位
产品应用7

当Sora2遇上国产 Vidu Q2,国产参考生真的更香了!一手亲测

国庆假期Sora 2吸睛,其客串功能将它拉到“AI版抖音”高度。但Vidu去年9月就提出【参考生】视频功能,Vidu Q2已是第5个迭代版本。文章对Vidu Q2参考生视频和Sora 2从一致性、物理规律遵循、运镜等维度进行PK。

量子位
新闻资讯7

AI Agent 是期运行的“风险系统”,如果你还只在防 Prompt Injection,说明已经落后一代了

AI安全公司CyberArk首席软件架构师Niv Rabin团队提出基于“指令检测”与“历史感知校验”的方法,防御大语言模型和AI Agent恶意输入与历史投毒攻击,介绍多种防御机制。

InfoQ
推荐文章8

火爆全网的《卢浮宫小猫》AI视频万字创作心得分享,这可能是他们最毫无保留的一次。

数字艺术家海辛和阿文分享《卢浮宫小猫》AI视频全流程创作心得,从选角、定调、音乐、分镜、美术到动画等环节,还提及废稿情况,强调模型便捷不应成偷懒理由,要把作品做得更好。

数字生命卡兹克
开源动态8

让模型“看视频写网页”,GPT-5仅得36.35分!上海AI Lab联合发布首个video2code基准

上海人工智能实验室等机构提出IWR - Bench评测基准,从“image - to - code”迈向“video - to - code”,对28个主流模型测试,最佳模型GPT - 5仅36.35分,指出当前模型短板,为研究指明方向。

量子位
算法论文8

该工作引来马斯克回复,让Gork破防:CoT是真正的推理,还是训练数据的统计插值?

大型语言模型(LLMs)的思维链(CoT)推理能力被视为突破性进展,但论文揭示CoT可能只是数据分布内的模式匹配幻象,通过实验证明其在分布偏移时表现急剧退化,挑战主流认知。

深度学习自然语言处理