像素级视觉世界模型」共找到 1534 篇相关文章

开源动态8

刚刚,DeepSeek开源OCR 2,首创Qwen编码的「双流架构」

年底 DeepSeek 开源新模型 DeepSeek - OCR 2,首创双流注意力架构,model&paper 一同发布。它重构视觉编码器,采用三阶段训练流程,在 OmniDocBench v1.5 评测及生产环境验证中表现良好。

PaperAgent
新闻资讯8

Claude Sonnet 4.5来了!能连续编程30多小时、1.1万行代码

十一假期前,DeepSeek 开源新模型 V3.2 - Exp,深夜 Anthropic 发布 Claude Sonnet 4.5,自称世界最好编码模型,自主编码时长超 30 小时,还带来系列产品升级,在多方面表现优异。

机器之心
新闻资讯7

中国足球还是靠机器人吧!首届机器人运动会闭幕:票价终究保守了

世界人形机器人运动会闭幕,清华火神队1-0胜德国队获机器人足球赛冠军。赛中有诸多有趣场面,且比赛背后硬核技术拉满,像足球赛用自主行动机器人,胜负关键在算法。

量子位
新闻资讯7

The Batch: 972|Grok 的 Cursor 联盟获得回报

SpaceXAI发布与Cursor联合开发的视觉 - 语言模型Grok 4.6,已向开发者开放。介绍其输入/输出、特性等信息,阐述工作原理、性能表现,还提及相关新闻背景、重要原因及期望。

DeeplearningAI
产品应用8

开源的 skill 被抄了千赞,我用 Lovart 给自己做了个品牌!

作者开源剪辑 Agent 被抄赞多,决定为账号做品牌视觉。其非设计师,用 Lovart 改变与 AI 沟通方式,通过 Brand Kit、字体生成器等完成系列设计,还能导出 PSD,沉淀 Skill。

AI产品自由
新闻资讯8

刚刚,马斯克发布Grok 4!全榜第一,年费飚到2万+

北京时间中午,马斯克现身 xAI 发布会发布 Grok 4,称其是世界最好的 AI。Grok 4 推理能力强,多类基准测试成绩领先,还在多方面能力获加强,已上线但付费昂贵。

机器之心
产品应用8

超震撼发布!全球首款实时生成游戏引擎Mirage来了

Mirage是全球首个实时生成引擎,借助先进AI世界模型实现实时UGC玩法,支持多种游戏类型。与其他成果相比优势显著,由定制模型驱动,打破传统游戏边界,让玩家动态创造新体验。

带你学AI
开源动态8

2天1k多星!BAGEL横空出世:字节跳动发布全球首个多模态全能AI,开启智能新纪元!

字节跳动推出开源多模态基础模型BAGEL,有70亿活跃参数。它在多模态理解排行榜超顶尖开源模型,文本到图像质量与SD3媲美,还具备世界建模等能力,文中介绍其方法、特性及使用说明。

GitHubStore
算法论文8

让机器人看视频学操作技能,清华等全新发布的CLAP框架做到了

近日,清华联合星尘智能、港大、MIT提出 CLAP 框架,能将视频运动空间与机器人动作空间对齐,解决‘数据饥荒’‘视觉纠缠’等问题,可让机器人从视频学技能,还缓解知识迁移难题,推动机器人产业化。

机器之心
推荐文章8

解决算力瓶颈,给多模态瘦身!Token压缩完整图谱与选型指南

给多模态大模型瘦身是解决算力瓶颈的关键。Token压缩技术可剔除视觉冗余,提升训练与推理效率。北大等团队剖析其全貌,给出完整图谱与选型指南,还揭示了未来演进路径。

AIGC开放社区