「图片编辑模型」共找到 7893 篇相关文章
nano-banana已登陆AI studio 和 Gemini ?果真是谷歌的gemini-2.5-flash图像预览版。。
作者分享玩AI视频创作的经历,介绍神秘AI图像生成和编辑模型Nano - Banana,它在LMArena平台出现,被猜测与谷歌新一代图像模型相关,功能出色。还体验了谷歌aistudio更新的gemini - 2.5 - flash - image - preview,认为其不如nano - banana。
下一代目标检测模型:3B参数MLLM Rex-Omni首度超越Grounding DINO,统一10+视觉任务
IDEA研究院团队用3B参数的Rex - Omni打破MLLM目标定位精度僵局。它统一视觉任务,结合坐标编码与强化学习,在多项检测基准超Grounding DINO等,解决定位和行为缺陷,为MLLM成下一代检测模型提供方案。
从“一句成片”到“长轨推演”:探究多模态智能体在长视频编辑中的应用
近年来大语言模型在长篇视觉叙事中潜力卓越,但长视频剪辑仍难控制。中科大等团队开源工作从系统工程视角研究多模态智能体在长视频编辑中的机制,重构剪辑管线,找到症结并给出解决办法。
英伟达4段简短提示词,IOI夺金!开源模型也能征服最难编程竞赛
英伟达研究者提出GenCluster框架提升开源LLM解题能力,让开源模型gpt - oss - 120b在IOI 2025获金牌级别高分。它执行‘海选+筛选+比拼+提交’流程,优势明显,标志开源AI里程碑式突破。
名师一定出高徒?清华团队最新揭秘:别再迷信大模型蒸馏的「免费午餐」
当下大模型后训练中,On-Policy Distillation(OPD)成明星技术,业界采用后报告性能提升。但清华团队研究发现,换更强Teacher,Student性能可能无提升甚至倒退。研究揭示蒸馏成败条件,深挖对齐机制,还给出拯救失败蒸馏的方法。
重新定义检索!一款真正“跨模态”的 RAG 模型来了!用音频搜视频、文本找音乐!
传统RAG有速度慢、细节丢失等问题。Vidore开源的ColQwen - Omni 3B多模态RAG模型,支持跨模态检索,能直接处理音视频原始数据,保留细节,检索速度快,还具备轻量高效等特性,适用于多场景。
PosterGen:告别学术海报制作烦恼,从PDF一键生成「演示级」可编辑PPTX学术海报
许多研究者制作学术海报耗时费力,现有自动化方法有缺陷。联合团队推出PosterGen,能将论文PDF转成可编辑PPTX海报。它有核心创新,遵循四大设计原则,工作流由四个智能体构成,实验证明其有效。
长视频AI数字人来了!字节×浙大推出商用级音频驱动数字人模型InfinityHuman
随着内容创作智能化需求爆发,长时长、高质量数字人视频生成是痛点。字节跳动联合浙大推出商用级模型InfinityHuman,打破传统技术局限,解决身份漂移和细节失真难题,已实现多场景商用。
比英伟达早,比李飞飞强,大晓Kairos原生一体化世界模型定义物理AI新路线
大晓机器人发布 Kairos 开悟世界模型,其首创“多模态理解 — 生成 — 预测”原生一体化架构,采用跨具身渐进式训练体系和“以人为中心”的数据金字塔,还实现端侧部署,在四大权威具身智能基准上全面登顶。
独家|极佳视界再获新一轮数十亿大额融资,估值超百亿,领跑世界模型赛道
AI科技评论独家获悉,极佳视界近日完成新一轮数十亿大额融资,投资方阵容豪华。其成立于2023年,在世界模型技术与应用上领先,产品在多领域落地,还计划年内开启大规模Scaling进程。