「参考图像转视频」共找到 1476 篇相关文章
只看图片就能学会压缩Token!浙大&阿里新框架多轮VQA压缩率90%,精度不掉|CVPR 2026
多轮视觉问答成LVLM推理效率“照妖镜”,现有压缩方法在多轮场景翻车。浙大宋明黎教授团队与阿里联合提出MetaCompress框架,可根据图像生成最优压缩映射,实验验证其效果优,能平衡压缩率与精度。
全球首个多模态矢量动画生成框架,轻松拿捏跨平台轻量动画
复旦大学等团队推出OmniLottie框架,利用创新分词技术将视频、图文指令变成高质量矢量动画。团队还打造数据集MMLottie - 2M,构建测试基准MMLottie - Bench。实验显示,OmniLottie在多任务测试中优势明显。
港大赵恒爽团队论文:让扩散模型既拿高分又不「作弊」丨CVPR 2026
扩散模型虽能生成逼真图像,但存在“奖励作弊”问题。港大赵恒爽团队提出 GDRO 后训练方法,引入组级奖励优化机制,提升模型表现、缓解作弊,还提高训练效率,有明显工程价值。
ICLR 2026|多模态大模型真的理解情绪吗?MME-Emotion给出了系统答案
多模态大模型迅速发展,但能否理解人类情绪存疑,且缺乏系统性评测框架。香港中文大学和阿里通义实验室团队提出 MME - Emotion 评测基准,评测 20 个主流模型,发现模型情感智能不足,为后续研究提供参考。
这个 AI 股票分析项目,居然快 2w star了?!
A股行情火热,盯盘分析耗时耗力。Github上的开源项目`daily_stock_analysis`基于AI大模型构建,能自动分析股票行情等,生成“AI决策仪表盘”,给出投资参考建议,目前已获18.1k+ Star。
皮皮虾也来了!超低成本超高效版OpenClaw
PicoClaw是超轻量级个人AI助手,灵感源于nanobot,用Go语言重构。它成本低、内存占用少、启动快,支持多架构。还介绍了安装、配置、聊天应用等使用方法,及命令行参考和定时任务功能。
治好多模态近视和走神!上海大学去偏干预显著提升模型性能
多模态大模型存在“近视”和“走神”问题,总是过度关注图像底部而忽略核心内容。上海大学与南开大学研究团队用两条数学公式去偏干预,无需增加计算成本,却能显著提升主流模型视觉理解能力。
OiiOii意外走红背后:为何10万人排队等一个不完美的AI Agent?|甲子光年
OiiOii是成立不到半年、团队仅十余人的初创公司,产品尚处内测,却引来近10万人排队申请。创始人闹闹有丰富履历,不回避产品缺陷,公司已获天使轮融资,将全力投入迭代。
10亿美元OpenAI股权兑换迪士尼版权!米老鼠救Sora来了
OpenAI官宣与迪士尼合作,将出售10亿美元股权,迪士尼获增持权利。Sora和ChatGPT Images能生成200多个迪士尼热门IP角色。合作三年,第一年授权排他,部分Sora视频或2026年初在Disney+播出。
马斯克「开颅插针」首破1.5秒!上万人挤爆,争当赛博格
Neuralink放出20分钟视频,联创阐述最新进展。手术机器人将单根电极植入时间从17秒降至1.5秒,植入深度超50mm。全球超万人排队,公司预计年底前20位患者完成手术,愿景是增强人类认知。