「多模态统一建模」共找到 1461 篇相关文章
中国 AI 正处于反超美国的前夜
2025下半年中美AI圈有新现象,一是认可中国AI崛起或反超,如海外企业用通义千问,MiniMax开源模型编程能力强;二是资本豪赌与泡沫风险加剧。中国AI成本低、性能优、ROI高,MiniMax或成中国版OpenAI。
被DeepSeek带火的OCR,最新8个开源模型盘点~
DeepSeek-OCR发布让OCR大热,PaperAgent梳理盘点8个热门开源OCR模型,如DeepSeek-OCR用‘上下文光学压缩’技术,Nanonets-OCR2-3B以零样本视觉链式思维为核心等。
释放创造力:解密 AI 贴纸生成器的“神级”提示词模板
文章介绍日本网友分享的 Gem 应用,可上传照片生成各种风格贴纸。详细阐述提示词模板概念、规律特点,还给出波普艺术、日式复古火柴盒等多种贴纸风格提示词库及可用情绪列表,最后鼓励读者动手尝试。
苹果端侧AI两连发!模型体积减半、首字延迟降85倍,iPhone离线秒用
苹果在Hugging Face放出FastVLM与MobileCLIP2两条多模态主线。前者主打「快」,首字延迟压到竞品1/85;后者突出「轻」,体积减半。模型和Demo已开放,开发者可集成开发。
你以为百度慢了,其实它在走一条最难的路
2025 WAIC 上,百度展示多项成果。萝卜快跑获上海牌照、入选‘国家展’,商业化加速;慧播星推 NOVA 数字人技术;飞桨平台等也入选‘国家展’。百度构建全栈架构,把 AI 从炫酷变好用。
PAS刊发西工大张伟伟教授智能流体力学重磅综述论文
西工大张伟伟教授团队受主编邀请,系统调研人工智能与流体力学交叉领域进展。通过科学计量学方法,展示发展脉络、现状与前沿方向,分析研究格局、梳理团队,为该领域提供全景图。
Claude Code有救了,这个开源的GUI解决了很多使用体验问题。
Claude Code强大但命令行操作不便,缺少历史记录、回滚等功能。开源的Claudia GUI工具解决诸多问题,将命令行转化为图形界面,支持会话管理、检查点回滚等,性能优异且跨平台。
o3绞尽脑汁仅答对40%的题目,开源模型基本乱猜?MMSI-Bench:多图空间智能试金石
文章介绍了MMSI - Bench,这是用于评估MLLM多图像空间推理能力的VQA基准。它人工构建样本、全面分类任务、采用多样真实数据。实验显示MLLM在多图像空间推理有短板,还开发自动化错误分析流程助力改进。
首创像素空间推理,7B模型领先GPT-4o,让VLM能像人类一样「眼脑并用」
当前主流视觉语言模型(VLM)依赖文本token间接翻译视觉信息,缺乏直接视觉操作能力。滑铁卢大学等团队提出「像素空间推理」范式,让VLM能像人类一样「眼脑并用」,在四大视觉推理基准测试中,7B的Pixel - Reasoner表现碾压GPT - 4o等。
纯靠“脑补”图像,大模型推理准确率狂飙80%丨剑桥谷歌新研究
剑桥、伦敦大学学院和谷歌团队推出基于强化学习的视觉规划(VPRL)新范式,纯靠图像推理。新框架利用GRPO后训练,准确率达80%,超文本推理至少40%,代码已开源。