「V4模型」共找到 8383 篇相关文章
视频模型假装在推理?MME-CoF新基准评估12个推理维度
视频生成模型如Veo - 3能生成逼真视频,但推理能力存疑。香港中文大学等校研究者设计12项测试,发现模型只能模仿表面模式,未真正理解因果。研究推出MME - CoF基准,为评估指明方向。
3 天上了两个 SOTA 模型,视频 Agent 们接得过来吗?
7月31日MiniMax H3和字节跳动Seedance 2.5同日发布,3天后H3开源,8月7日Seedance 2.5开放api。模型变强使产品层要做的事更多,视频Agent需解决生产问题,竞争走向模型层之上。
一个全新的世界模型,终于让AI视频进入了“无限流”时代。
AI视频公司PixVerse推出实时世界生成模型PixVerse R1,用户可输入Prompt修改视频进程,无干涉时视频会自行延续。该模型为世界模型补上实时视频生成方向,实测体验乐趣十足。
少说‘Wait’,多做题:NoWait重塑大模型推理路径
现代大模型在复杂推理时爱用自我反思词,触发冗余验证循环,拖慢速度、增加算力消耗。NoWait方法零训练成本,通过抓关键词、扩展变体、实时屏蔽,让模型跳过废话,在多任务中表现出色,且颠覆对推理的认知。
世界首个!李飞飞团队推出物理推理基准,大模型统统不及格?
斯坦福联合中科大团队推出世界首个评估视觉语言模型物理推理能力的基准QuantiPhy,通过测试发现顶尖模型在数值计算上不如人类,还揭示模型推理靠记忆而非测量,为AI发展指明方向。
WAIC抢先爆料:金融“黑马”大模型超DeepSeek刷新SOTA,论文已上线
WAIC期间,蚂蚁数科金融推理大模型发布会未开,论文已上线。其新模型Agentar - Fin - R1有8B和32B版,在金融测评集超DeepSeek等,还兼顾专业与通用,蚂蚁数科还提出评测基准Finova。
微软等提出「模型链」新范式,与Transformer性能相当,扩展性灵活性更好
随着大语言模型发展,扩展 Transformer 架构成趋势,但参数规模增长带来训练负担。微软等研究者提出 CoR 概念,构建模型链学习范式,应用于语言模型得 CoLM 系列,实验显示其性能相当且扩展性、灵活性更好。
不可思议!400B大模型在iPhone上跑起来了
一个跑在 iPhone 17 Pro 的 A19 Pro 芯片上的 400B 大模型 Qwen3.5 - 397B - A17B 引发关注。这源于 Flash - MoE 开源项目,它摒弃现代 AI 框架,回归底层开发,实现消费级硬件上大模型交互级速度运行。
北大校友Lilian Weng出镜,爆出120亿估值首个交互模型!
北大校友Lilian Weng出镜介绍Thinking Machines的交互模型,此模型200毫秒神同步,能感知协作。该公司此前获20亿美元种子轮融资,估值达120亿美元。模型打破传统交互局限,或改变人机互动方式。
句子级溯源+生成式归因,C²-Cite重塑大模型可信度
在人工智能发展背景下,大模型内容可信度成焦点。北邮百家AI与小米团队提出溯源大模型C² - Cite,首创上下文感知归因生成技术,解决现有归因模型缺陷,已被WSDM 2026收录。