「多模态框架」共找到 2422 篇相关文章
可灵3.0系列模型正式上线:属于每个人的导演时代来临
可灵AI正式全球上线3.0系列模型,覆盖影视级全流程链路。该系列基于All-in-One理念构建,解决了行业一致性等问题,在多方面做了增强,完成从单点生成到专业调度的跃迁,让AI成创作协作者。
中国 AI 正处于反超美国的前夜
2025下半年中美AI圈有新现象,一是认可中国AI崛起或反超,如海外企业用通义千问,MiniMax开源模型编程能力强;二是资本豪赌与泡沫风险加剧。中国AI成本低、性能优、ROI高,MiniMax或成中国版OpenAI。
被DeepSeek带火的OCR,最新8个开源模型盘点~
DeepSeek-OCR发布让OCR大热,PaperAgent梳理盘点8个热门开源OCR模型,如DeepSeek-OCR用‘上下文光学压缩’技术,Nanonets-OCR2-3B以零样本视觉链式思维为核心等。
8000行Python+Rust手搓ChatGPT,日收14.5k星!Karpathy:Agent只会帮倒忙
特斯拉前AI总监Andrej Karpathy发布开源项目nanochat,可搭建简易版ChatGPT复现模型。约8000行代码,成本低,功能多。卡帕西称手写代码,用Agent效果差,项目受网友热赞。
苹果端侧AI两连发!模型体积减半、首字延迟降85倍,iPhone离线秒用
苹果在Hugging Face放出FastVLM与MobileCLIP2两条多模态主线。前者主打「快」,首字延迟压到竞品1/85;后者突出「轻」,体积减半。模型和Demo已开放,开发者可集成开发。
你以为百度慢了,其实它在走一条最难的路
2025 WAIC 上,百度展示多项成果。萝卜快跑获上海牌照、入选‘国家展’,商业化加速;慧播星推 NOVA 数字人技术;飞桨平台等也入选‘国家展’。百度构建全栈架构,把 AI 从炫酷变好用。
Claude Code有救了,这个开源的GUI解决了很多使用体验问题。
Claude Code强大但命令行操作不便,缺少历史记录、回滚等功能。开源的Claudia GUI工具解决诸多问题,将命令行转化为图形界面,支持会话管理、检查点回滚等,性能优异且跨平台。
o3绞尽脑汁仅答对40%的题目,开源模型基本乱猜?MMSI-Bench:多图空间智能试金石
文章介绍了MMSI - Bench,这是用于评估MLLM多图像空间推理能力的VQA基准。它人工构建样本、全面分类任务、采用多样真实数据。实验显示MLLM在多图像空间推理有短板,还开发自动化错误分析流程助力改进。
首创像素空间推理,7B模型领先GPT-4o,让VLM能像人类一样「眼脑并用」
当前主流视觉语言模型(VLM)依赖文本token间接翻译视觉信息,缺乏直接视觉操作能力。滑铁卢大学等团队提出「像素空间推理」范式,让VLM能像人类一样「眼脑并用」,在四大视觉推理基准测试中,7B的Pixel - Reasoner表现碾压GPT - 4o等。
字节跳动2步突破,复杂文档布局解析,为啥如此惊艳?
文章指出现有文档图像解析方案有局限,介绍字节跳动的Dolphin解决方案。它采用分析 - 解析范式分两阶段解析文档,避免传统方法弊端,运行效率高,还给出训练方案、实战代码和试用链接。