「多参考图」共找到 4429 篇相关文章
NVIDIA开源“Banana”级黑科技!会懂物理、理解时间的图像编辑模型!
继谷歌Banana后,英伟达开源物理级图像编辑模型ChronoEdit - 14B,被称‘NVIDIA版的Banana’。它有‘时间观念’和‘物理常识’,能按描述生成符合物理规律图像,适用于多领域。
AI们数不清六根手指,这事没那么简单。
作者测试发现Grok4、OpenAI o3等多模态模型都将六指图数成五指,仅Claude 4偶尔答对。研究揭示大模型看图片用记忆而非视觉,易受刻板印象影响,在工业等场景或引发严重后果。
开源真强大,不敢相信,太真实,揭秘8.3k star 开源神器 VoiceCraft 如何封神!!!
VoiceCraft 是多团队合作推出的零样本语音编辑与 TTS 开源项目。它能几秒克隆语音,实现编辑功能,支持零样本文本转语音,在真实场景音频中性能超 XTTS - v2、VALL‑E 等模型,解决了内容创作和编辑痛点。
港中文 MMlab×美团新研究:仅用一个模型,应对多种视觉推理任务
港中文 MMLab 与美团联合提出 OneThinker 多模态统一推理模型,将多种视觉任务抽象为‘先推理、后作答’形式,通过多任务强化学习优化。实验显示其在多任务表现佳,为通用视觉推理模型提供参考。
充分激发模态协作,MokA量身打造MLLM微调新范式
当下多模态大模型微调多「照搬」单模态微调策略,忽视模态差异。中国人民大学和上海人工智能实验室团队提出 MokA 方法,兼顾单模态与跨模态建模,在多基座、多场景实验中显著提升性能。
7.3K Star!用 Orca 组建 AI 舰队:让 Claude Code 和 Codex 同时开工!
Claude Code 大火后,多家大厂推出自家 Code CLI,多终端操作上下文切换成本高。Orca 是开源 AI 编排器,可让多个 AI 编程助手并行工作,集中查看结果,有并行工作区、统一管理界面等亮点。
现场围观腾讯广告算法大赛,我都想入职了
腾讯广告算法大赛冠军可得200万奖金,赛题是「全模态生成式推荐」,涉及多AI方法,贴近真实业务且挑战多。比赛持续四月多,氛围友好。腾讯借此揽才,也为学生提供进大厂通道。
哇塞,今天北京被机器人人人人人塞满了!
世界机器人大会在北京开幕,100多个新机器人亮相。智平方的爱宝机器人人气爆棚,它能用一个基座模型完成多任务。其搭载的GOVLA大模型有四大核心能力,且已在多行业商业化落地。
全能高手&科学明星,上海AI实验室开源发布『书生』科学多模态大模型Intern-S1 | WAIC 2025
7月26日,上海AI实验室在WAIC 2025上发布并开源科学多模态大模型Intern-S1。它融合多学科知识,首创跨模态科学解析引擎,在多学科任务上超越顶尖闭源模型,还支撑构建了多智能体系统。
腾讯混元Hy3发布:Agent能力和产品体验跃升
7月6日腾讯混元Hy3发布,智能水平强于同尺寸模型,比肩大尺寸旗舰模型,定价降低。它已接入多个业务,API上线腾讯云TokenHub。在多领域表现出色,性价比高,采用开源协议,将在多平台上线。