「BLIP3 - o」共找到 2242 篇相关文章
让视觉语言模型像o3一样动手搜索、写代码!Visual ARFT实现多模态智能体能力
上海交大等团队推出多模态智能体训练方法 Visual-ARFT,让视觉语言模型有「工具智能体」能力,还开源项目。它能自动调用工具、拆解任务,团队构建 MAT-Bench 评测,其在多任务超 GPT-4o。
生图效果媲美GPT-4o,一键搞定各类视觉生成任务丨港科广&字节全新框架
港科大(广州)和字节联合推出开源框架ComfyMind,它是通用视觉生成框架,能统一处理主流视觉生成任务。其性能超现有开源方法,媲美GPT - 4o - Image,还介绍了架构、接口等及性能评估情况。
CVPR2026满分论文:Proxy-GS为结构化3D高斯溅射引入统一遮挡先验
上海交通大学钟志航团队等在CVPR 2026提出Proxy - GS,面向基于MLP的结构化3D高斯溅射,用轻量级代理网格将遮挡关系变为可见性信号。在推理和训练阶段发挥作用,在遮挡密集场景实现渲染加速,画质与速度均优。
社区供稿丨如何抑制大模型的“过度反思”:Yuan3.0 Flash 中的强化学习范式
大模型在企业落地时存在“过度反思”问题,浪费算力。YuanLab.ai团队在Yuan3.0 Flash模型中提出RIRM与RAPO,前者奖励“思考过程”,后者优化训练框架,实现推理效率提升,适用于企业场景。
下一代目标检测模型:3B参数MLLM Rex-Omni首度超越Grounding DINO,统一10+视觉任务
IDEA研究院团队用3B参数的Rex - Omni打破MLLM目标定位精度僵局。它统一视觉任务,结合坐标编码与强化学习,在多项检测基准超Grounding DINO等,解决定位和行为缺陷,为MLLM成下一代检测模型提供方案。
Runway重夺全球第一!1247分碾压谷歌Veo3,没有千亿算力也能干翻科技巨头
Runway Gen - 4.5击败谷歌Veo3,以1247的ELO分数在Artificial Analysis榜单中重夺AI视频王座。它在多方面树立新标杆,虽有局限,但创始人认为其是通用模拟引擎,应用场景广泛。
256G比5090还贵!内存一年暴涨3倍,全球为奥特曼豪赌买单
全球内存供不应求,价格一年暴涨3倍。奥特曼的采购锁定40%产能,巨头转向高利润AI产品致中低端内存锐减。2026年内存短缺或重塑市场,GPU也将涨价,大家都要为AI发展买单。
刚刚,HiDream-O1-World首秀登顶,原生全模态UiT架构打造「可交互时代」
过去三年,AI 内容生成行业虽有技术迭代,但用户与模型交互仍单向。智象未来发布全球首款原生全模态交互式世界模型 HiDream - O1 - World,它基于 UiT 架构,在评测中表现出色,解决两大行业难题,应用前景广。
蚂蚁深夜开源比肩Genie 3的世界模型,我也看到了具身智能的未来。
蚂蚁旗下灵波科技凌晨开源世界模型LingBot-World,可对标Google Genie 3。它能实时交互生成世界,与视频生成模型不同。有三个版本,具备长时记忆稳定、风格泛化性强、动作代理出色等特点。
说实话提前拿到Qwen3.7-Max内测,最让我意外的不是它推理变强了!
作者提前2天拿到Qwen3.7-Max内测,经测试,该版本补齐短板,综合能力强。审美提升明显,代码质量不错,长程思考推理迭代能力佳,适合替换到部分工具里。