「多模态论文」共找到 1881 篇相关文章
中心动态重分配哈希,北邮团队提出并开源CRH项目 | AAAI 2026
北京邮电大学等机构联合提出新颖端到端框架 CRH,在训练哈希函数时动态更新哈希中心,提升检索精度和语义一致性。论文被 AAAI 2026 收录,代码已开源。
中国 AI 正处于反超美国的前夜
2025下半年中美AI圈有新现象,一是认可中国AI崛起或反超,如海外企业用通义千问,MiniMax开源模型编程能力强;二是资本豪赌与泡沫风险加剧。中国AI成本低、性能优、ROI高,MiniMax或成中国版OpenAI。
被DeepSeek带火的OCR,最新8个开源模型盘点~
DeepSeek-OCR发布让OCR大热,PaperAgent梳理盘点8个热门开源OCR模型,如DeepSeek-OCR用‘上下文光学压缩’技术,Nanonets-OCR2-3B以零样本视觉链式思维为核心等。
每周7亿人都在如何用ChatGPT?OpenAI最全报告来了
OpenAI联合哈佛大学经济学家发表论文《How People Use ChatGPT》,基于内部对话数据,分析ChatGPT从2022年11月上线到2025年7月的使用情况。截至7月,周活超7亿,每周发消息180亿条。
苹果端侧AI两连发!模型体积减半、首字延迟降85倍,iPhone离线秒用
苹果在Hugging Face放出FastVLM与MobileCLIP2两条多模态主线。前者主打「快」,首字延迟压到竞品1/85;后者突出「轻」,体积减半。模型和Demo已开放,开发者可集成开发。
你以为百度慢了,其实它在走一条最难的路
2025 WAIC 上,百度展示多项成果。萝卜快跑获上海牌照、入选‘国家展’,商业化加速;慧播星推 NOVA 数字人技术;飞桨平台等也入选‘国家展’。百度构建全栈架构,把 AI 从炫酷变好用。
DeepResearch的概念、核心挑战与进化路径
华为、利物浦大学等研究者撰写综述文章《DEEP RESEARCH AGENTS》,梳理了DeepResearch进展。它由大语言模型驱动,超越RAG等现有技术,介绍其核心技术组件,指出面临的挑战并指明未来发展方向。
Claude Code有救了,这个开源的GUI解决了很多使用体验问题。
Claude Code强大但命令行操作不便,缺少历史记录、回滚等功能。开源的Claudia GUI工具解决诸多问题,将命令行转化为图形界面,支持会话管理、检查点回滚等,性能优异且跨平台。
o3绞尽脑汁仅答对40%的题目,开源模型基本乱猜?MMSI-Bench:多图空间智能试金石
文章介绍了MMSI - Bench,这是用于评估MLLM多图像空间推理能力的VQA基准。它人工构建样本、全面分类任务、采用多样真实数据。实验显示MLLM在多图像空间推理有短板,还开发自动化错误分析流程助力改进。
首创像素空间推理,7B模型领先GPT-4o,让VLM能像人类一样「眼脑并用」
当前主流视觉语言模型(VLM)依赖文本token间接翻译视觉信息,缺乏直接视觉操作能力。滑铁卢大学等团队提出「像素空间推理」范式,让VLM能像人类一样「眼脑并用」,在四大视觉推理基准测试中,7B的Pixel - Reasoner表现碾压GPT - 4o等。