「视频推理数据集」共找到 4979 篇相关文章

新闻资讯7

10亿美元OpenAI股权兑换迪士尼版权!米老鼠救Sora来了

OpenAI官宣与迪士尼合作,将出售10亿美元股权,迪士尼获增持权利。Sora和ChatGPT Images能生成200多个迪士尼热门IP角色。合作三年,第一年授权排他,部分Sora视频或2026年初在Disney+播出。

量子位
8

马斯克「开颅插针」首破1.5秒!上万人挤爆,争当赛博格

Neuralink放出20分钟视频,联创阐述最新进展。手术机器人将单根电极植入时间从17秒降至1.5秒,植入深度超50mm。全球超万人排队,公司预计年底前20位患者完成手术,愿景是增强人类认知。

新智元
新闻资讯8

谷歌新架构突破Transformer超长上下文瓶颈!Hinton灵魂拷问:后悔Open吗?

谷歌在NeurIPS 2025发布两项大模型新架构研究,通过‘测试时训练’机制,推理阶段可将上下文窗口扩展至200万token。新成果Titans和MIRAS结合RNN速度与Transformer性能,突破超长上下文瓶颈。

量子位
新闻资讯7

刚刚,OpenAI发长文:找到缓解LLM撒谎的方法!

Google发布Gemini 3 Deep Think,ARC - AGI - 2准确率高且采用并行推理技术。OpenAI发长文《通过忏悔训练大型语言模型诚实性》,介绍缓解LLM撒谎的忏悔训练法、实验结果等,也指出其局限。

PaperAgent
新闻资讯8

从 LLM 到 World Model:为什么我们需要能理解并操作世界的空间智能?

文章指出 LLM 仅靠语言不足以支撑真正智能,构建空间智能与世界模型成关键方向。2024 年李飞飞等创立 World Labs,11 月推出 3D 世界生成模型 Marble,本文探讨空间智能重要性及世界模型如何成转变基础设施。

海外独角兽
开源动态8

DeepSeek在Agent上做了件大事!

昨天DeepSeek发布V3.2正式版,强化Agent能力并融入思考推理,其在Agent评测达开源模型最高水平。文中分析Agent成开源‘心病’的痛点,介绍DeepSeek相关解决策略及成果,还给出使用示例。

PaperAgent
算法论文7

预测下一个像素还需要几年?谷歌:五年够了

谷歌DeepMind研究者分析下一像素预测在图像识别与生成任务中的扩展特性。实验显示其扩展趋势与文本类似但效率低,最优策略因任务和分辨率而异,预计未来五年逐像素建模可行。

机器之心
开源动态8

清华团队:1.5B 模型新基线!用「最笨」的 RL 配方达到顶尖性能

清华团队用两个 1.5B 模型证明,用最基础的 RL 配方可达到小模型数学推理能力 SOTA。单阶段训练加固定超参数实现 SOTA 性能且省一半算力,训练曲线还很平滑。

机器之心
新闻资讯7

一边秀肌肉,一边设围墙,NVIDIA 发布 OmniVinci,性能碾压 Qwen2.5-Omni,却被骂“假开源”

NVIDIA 推出多模态大语言模型 OmniVinci,结合架构创新与数据合成流水线,训练 token 仅为 Qwen2.5 - Omni 的六分之一,却在多项基准测试表现更佳。但采用限制商业用途的许可证,引发争议。

AI前线
新闻资讯7

一边秀肌肉,一边设围墙,NVIDIA 发布 OmniVinci,性能碾压 Qwen2.5-Omni,却被骂“假开源”

NVIDIA 推出多模态大模型 OmniVinci,结合架构创新与合成数据流水线,训练 token 仅为 Qwen2.5 - Omni 的六分之一,却在多项基准测试表现更佳。但采用限制商业用途的许可证,引发“假开源”争议。

InfoQ