视觉世界模型」共找到 8137 篇相关文章

算法论文8

模拟大脑功能分化!北大与港中文发布Fast-in-Slow VLA,让“快行动”和“慢推理”统一协作

北大与港中文研究团队发布 Fast-in-Slow(FiS-VLA)全新双系统视觉 - 语言 - 动作模型,将快速执行模块嵌入预训练视觉 - 语言模型,实现快慢系统一体化。该模型在多平台表现优异,控制频率大幅领先。

机器之心
开源动态8

小红书团队开源dots.ocr:文档解析新王者,性能比肩Gemini!

文档解析领域处理多语言复杂文档需高效能力,传统OCR工具存在不足。小红书HiLab开源多语言文档解析模型dots.ocr,基于1.7B参数视觉语言模型,性能达SOTA,单页PDF处理快,公式识别媲美大模型

开源星探
算法论文8

大语言模型逻辑评估

现有归因问答评估方法有‘归因短视’问题,研究团队提出 LOGICSCORE 框架,从三维度量化推理质量。在多数据集测试多款 LLM,发现专有、开源模型等存在不同逻辑问题,还分析典型逻辑错误。

深度学习自然语言处理
算法论文8

扩散语言模型九倍推理加速!上海交大:KV Cache并非自回归模型的专属技巧

上海交通大学EPIC Lab团队提出免训练推理缓存机制dLLM - Cache,复用特征降低计算量。它即插即用,通用于主流dLLM架构,在多个基准测试中实现数倍推理加速,且不降低生成质量。

量子位
算法论文8

Agent也能蒸馏了!性能超好

模型运行成本高,普通用户用不起。传统小模型模仿大模型解题步骤易出错。论文提出Agent蒸馏,让小模型学会用检索和代码工具,还加首思前缀与自我纠错“外挂”,使小模型性能直逼大模型

深度学习自然语言处理
新闻资讯8

黄仁勋2026大模型座上宾:杨植麟

在英伟达2026年GTC大会嘉宾中,杨植麟是唯一来自独立大模型创业公司的代表。过往黄仁勋邀人有“风口预言术”,此次选杨植麟,或因他搞出K2.5、死磕推理效率,能给英伟达讲新故事。

量子位
开源动态8

不改模型、不降质量,谷歌让Gemma 4快了3倍:本地跑大模型彻底变天

谷歌给Gemma 4家族更新Multi - Token Prediction推测解码架构,推理速度最高提升3倍且输出质量不变。介绍了LLM推理慢的原因、MTP解决办法、对开发者的利好、技术细节、使用方式等。

AI寒武纪
推荐文章8

揭秘大模型Steering:从底层机理到系统评估,全面破解大模型行为控制之谜

近期《Science》研究表明可解析AI内部表征实现通用引导与监控。浙大联合阿里两篇ACL 2026主会论文,揭示Steering工作原理与能力边界,还开源一站式框架EasyEdit2,全面展示了Steering价值。

机器之心
开源动态8

推理快30%,性能超过千亿参数模型,15B模型Apriel-1.6重新定义端侧推理

ServiceNow人工智能团队发布的Apriel-1.6-15b-Thinker,以150亿参数体量,多模态推理能力强,推理Token消耗降超30%。它在AI分析指数成绩佳,优化计算成本,还介绍了训练策略与多维度性能实测情况。

AIGC开放社区
产品应用8

Claude Code 推出 /Ultraplan,超级计划模型

Claude Code 推出 `/ultraplan` 功能,在写代码前提供可视化方案,可编辑、审批。还发布了 Claude for Word 集成微软 Office 套件。Anthropic 迭代快或因内部使用更强的 Mythos 模型

AGI Hunt