「VLOA大模型」共找到 9331 篇相关文章
500万视频数据集+全新评测框架!北大开源主体一致性视频生成领域新基建OpenS2V-Nexus,生成视频 「像」 又 「自然」
北大团队推出开源套件OpenS2V - Nexus,含全球首个S2V细粒度评测基准OpenS2V - Eval和500万条高质量人物文本视频三元组数据集OpenS2V - 5M,还评测18个S2V模型,揭示主流模型能力差距。
1000+页PDF解析速度暴涨3倍,MinerU模式不香了
百度PaddleOCR推出HPD - Parsing小模型,文档解析速度大幅提升,是上一代最快模型的1.62倍、自身原解码方式的3.06倍。它采用层级并行解码架构,有两层并行设计,效果出色且兼容性好,还分享了优质训练方法和优化思路。
不卷速度卷验证,陈天桥MiroMind精准预测15天后黄金价格
陈天桥带队的MiroMind发布新一代重型推理智能体MiroThinker-1.7和MiroThinker-H1,在基准测试中表现优异,超越众多顶尖模型。该模型不仅通用任务强,在科技金融等专业领域也表现亮眼,还能承担真实长链条智力任务。
MiniMax 技术闭门会分享:长上下文是 Agent 的 Game Changer
MiniMax 7月10日举办M1技术研讨会,探讨模型架构创新等领域。会议围绕RL能否赋予模型新能力、预训练价值等展开,指出长上下文是Agent的Game changer,混合架构将成主流,还分享了混合架构推理实践及M1相关问答。
刚刚,首个能在机器人上本地运行的具身Gemini来了
谷歌DeepMind推出Gemini Robotics On-Device,这是首个可部署在机器人上的VLA模型,无需联网,能让机器人适应新任务和环境。还将发布SDK助开发者评估。此外,谷歌下调Gemini免费额度,推出图像生成模型Imagen 4和Imagen 4 Ultra。
Jev是分类器吗?今天向所有人开放,送1.2亿token
近期大火的Jev模型由TypeSafe AI推出,现已向所有用户开放,新用户可获得5美元额度约合1.2亿token。该模型主打快速结构化判断,引发AI社区热议,围绕其定位、能力优劣也有不少讨论与实测。
编程超越 Gemini 3 Pro?GLM-5 性能实测对齐 Opus 4.6,智谱市值突破1700亿港元
临近春节,智谱AI发布最新旗舰大模型GLM-5,其代码和智能体能力表现出色,在多方面逼近Claude Opus 4.5,性能超Gemini 3 Pro。该模型已开源,依托国产芯片部署,不过受算力限制,将逐步向用户开放。
为什么 2025 的基模公司都押注 Interleaved Thinking?
本文探讨 2025 年基模公司押注 Interleaved Thinking 的原因。从大模型迭代说起,介绍其在多模型中的体现,阐述该思维链对 Agent 的重要性,还提及 MiniMax 在推动其成行业标准上的诸多努力及带来的影响。
1.5B刷新数学代码SOTA!快手&清华精细化Token管理,LLM推理能力飙升
快手与清华团队用1.5B参数小模型在推理基准上超越同量级SOTA。其Archer方法通过精细化Token管理,对知识型和推理型Token差异化训练,让知识和推理同步更新且互不干扰,在数学和代码任务表现出色。
英伟达周末双炸!CUDA二十年最大更新,顺手屠榜AGI比赛
本周末英伟达有两大动作。一是推出CUDA 13.1,这是CUDA平台诞生二十年来最大更新,引入CUDA Tile编程模型等。二是在Kaggle ARC Prize 2025竞赛中,团队用4B小模型变体夺冠,靠合成数据等策略。