「像素级视觉世界模型」共找到 1534 篇相关文章
ACL最佳论文幕后的北大人!北大张铭带出顶会常胜军和百亿CEO天团|新智元十周年峰会
北大张铭教授团队十年两度获世界顶会「最佳论文」,学生有人写大奖论文,有人创办百亿企业,高中生也能参与科研拿奖。其将科研思维与创新教育结合,走出独特人才培养路径。
「只参与,不参赛」奖牌数却仅次于宇树,这个幕后玩家如何做到的?
2025年世界人形机器人运动会,宇树科技获奖最多,没参赛的加速进化T1获奖牌数排第三。这家新公司选不同发展路径,重产品与生态,技术应用于多场景,有望成行业‘苹果’。
人形机器人不再「走走停停」:Current Robotics发布全身灵巧操作模型Curr-0
具身智能领域中,让机器人移动中精细操作一直未被很好解决。Current Robotics发布全身灵巧操作模型Curr - 0,用Single Policy统一策略,数据源于自研外骨骼系统,还构建世界模型解决评测部署难题。
开源SOTA!商汤原生多模态一个大脑完成看图、推理、作画
商汤开源日日新SenseNova U1,用NEO - unify架构让像素和文字自由协作,多项指标达开源SOTA,适配10家国产芯片。它能完成看图、推理、作画等多任务,虽有局限,但后续优化值得期待。
将文章、故事变成漫画脚本提示词参考
文章给出将文章、故事变成漫画脚本的提示词参考,包含生成脚本和画图示例对话,从视觉风格、封面设计、布局、叙事结构、对话与文字设计等方面提出详细要求,为漫画脚本创作提供指引。
一个模型读懂所有医学数据,Hulu-Med探索医学大模型开源新范式 | 浙大x上交xUIUC
Hulu - Med是浙大、上交、UIUC等联合提出的通用医学视觉语言大模型,首次在单一模型统一理解医学多类数据。它开源透明,训练成本低,性能媲美GPT - 4.1,为医学AI带来新范式。
谷歌又赢了,nano banana「被迫」改名后,网友搞出7种神仙玩法
谷歌神秘图像编辑模型 nano banana 改名后仍热度高,与竞品相比生成速度快、成本低、能力强。已在 Gemini 应用和 Google AI Studio 上线,网友开发出制作等距模型、标注现实世界等7种玩法。
刚刚,Bengio官宣创业!急筹3000万专治AI欺骗人类,图灵三巨头全下场
图灵奖得主Yoshua Bengio官宣创办非营利机构LawZero,致力于研发「设计即安全」的AI系统,以应对AI军备竞赛风险。其研发的「Scientist AI」不具行动性,目标是理解世界,防止人类陷入AI风险。
DeepSeek开源的不仅仅是个新OCR模型。。。
DeepSeek开源3B参数的新OCR模型,重新思考AI处理长文本方式,用视觉token压缩文本信息。核心组件有DeepEncoder和DeepSeek3B - MoE解码器,实验效果好,成本降低,还解决了一些算法和工程问题。
多模态推理最高加速3.2倍!华为诺亚新算法入选NeurIPS 2025
华为诺亚方舟实验室研究入选NeurIPS 2025,其提出视觉感知投机推理(ViSpec)框架,解决草稿模型处理图像信息效率难题,在不牺牲生成质量下,对主流VLM最高达3.22倍推理加速。