高刷视频理解」共找到 1647 篇相关文章

新闻资讯7

DeepSeek、GPT、Qwen,所有大模型架构图都有,Karpathy:宝藏画廊!

大模型赛道热闹,架构创新多,理解困难且缺清晰架构图。AI 研究者 Sebastian Raschka 绘制主流大模型结构,整理成在线图谱「LLM Architecture Gallery」,方便研究者查阅对比。

机器之心
算法论文8

ICLR-26腾讯混元:Agent是强大的,但用户是狂野的

现有LLM工具使用基准测试场景理想化,忽视真实用户行为复杂性。腾讯提出WildToolBench,基于真实用户行为构建测试集,对58个模型评估,发现模型准确率低,揭示LLM在真实场景下能力缺口,为模型优化指明方向。

PaperAgent
新闻资讯8

Jeff Dean最新访谈:未来开发者人均50个智能体,写需求成核心技能

谷歌首席AI科学家Jeff Dean在访谈中预言,未来开发者人均管理50个智能体,写需求成核心技能。他还揭秘谷歌帕累托前沿策略,介绍蒸馏技术让小模型接近大模型性能,强调多模态及低延迟价值,给出未来模型发展预测。

量子位
产品应用8

谷歌Gemini 3.1新模型深夜掀桌, 每秒狂飙363 token! 1/4价格暴击Claude

谷歌深夜推出Gemini 3.1 Flash-Lite,输出速度363 token/s,价格仅0.25美元/百万Token,跑分碾压GPT-5 mini和Claude 4.5 Haiku。开发者可通过Google AI Studio体验,企业用户可通过Vertex AI接入。

新智元
开源动态8

字节开源版Seedance发布,超越Sora 2!

字节Alive团队发布开源版Seedance 2.0,在人类评估中超越Sora 2等。它通过统一架构、时空对齐技术和非对称训练策略,解决声画不同步和画质音质难两全问题,还建立数据流水线和测试基准。

AIGC开放社区
开源动态8

视觉强≠能干活!清北普林斯顿等开源WorldArena,世界模型评测被颠覆

2026 年 2 月 13 日,清华、北大等顶尖机构联合推出的 WorldArena 面向全球开源。这是首个‘功能 + 视觉’统一评测体系,撕开了‘美丽视频’伪装,让评测从‘审美导向’走向‘功能导向’。

机器之心
产品应用7

马斯克转帖,发现了一个有趣的中国 AI 初创产品!

马斯克转帖一个搞怪视频,其中互动内容由AI工具Loopit制作。Loopit是北京涌跃智能科技有限公司新推出的产品,介于Sora App和Spielwerk之间,玩法多样,或掀起一波风浪。

特工宇宙
新闻资讯7

Karpathy盛赞,啥都没有的创业公司刚融了1.8亿美元,要用小数据造强智能

AI创业公司Flapping Airplanes几乎无产品、盈利,也不急于商业化,却获1.8亿美元融资及Andrej Karpathy力挺。它专注解决“数据效率”问题,探索新思路,目标是做改变范式的研究。

机器之心
新闻资讯7

Anthropic突然封禁第三方工具调用Claude,Cursor、OpenCode、xAI 集体“中枪”!项目做到一半突遭中断,官方解释是“误伤”?

Anthropic突然阻止第三方工具调用Claude,引发社区不满。开发者在项目进行中访问权限中断,官方称是‘误伤’,但实则是对第三方工具使用路径的调整,社区对此反应不一。

InfoQ
算法论文7

视觉优势还是语义依赖?揭秘 DeepSeek-OCR 高压缩率背后的真相

中科院等团队论文剖析 DeepSeek - OCR,通过实验揭示其高压缩率下准确率高或依赖语言先验。去掉语言先验,准确率暴跌;下游任务推理崩塌,长文本处理也有瓶颈。

深度学习自然语言处理