「图像理解与生成」共找到 2974 篇相关文章
Seedance 2.0之后,又一中国视频模型SkyReels-V4登上全球第二
昆仑天工发布SkyReels V4视频大模型,在Artificial Analysis Arena基准测试中排全球第二。它支持多模态输入、音视频同步生成等,采用独特架构与技术,经多阶段训练,有全新评估基准,表现出色。
开源即爆火!英伟达重磅推出OmniVinci全模态大模型
英伟达在华盛顿GTC大会开源OmniVinci全模态大语言模型,实现视觉、音频、语言统一理解。它性能超竞品,架构有创新,数据引擎庞大。实验有重要洞察,在多场景表现佳,代表全新AI范式。
基于DINOv2和SAM2改进的U-Net模型
DSU-Net是基于DINOv2和SAM2改进的U-Net模型,通过多尺度跨模型特征协作和轻量级适配器模块,解决现有图像分割模型在特定下游任务表现不足问题,提升分割精度,降低训练成本。
RSS 2025 软硬件全开源,智源清华带来混动灵巧脸Morpheus
清华大学赵昊团队联合多家机构发布高拟真机器人面部系统Morpheus,融合三项关键技术,能实时生成多种细腻表情。它在核心指标表现出色,有三大创新突破传统瓶颈,为下一代情感机器人奠定技术基座。
AI 领域最''不务正业''的团队,可能做了一件最正确的事
马卡龙是一款主打帮助用户更好生活的个人智能体,有深度记忆和生成定制化生活场景小应用两大核心特点。它区别于生产力智能体,有技术积累,基础聊天免费,开发小应用收费。
The Batch:836 | 基准测试成本攀升
独立AI测试实验室披露评估推理模型成本上升。这些模型生成“思维链”提升输出质量,但计算需求增加,成本上升使资源有限组织难复现结果,且新模型定价、按需分配推理token也让成本更复杂。
0.5B以小搏大拿下端侧模型新SOTA:4090可跑,长文本处理5倍常规加速丨清华&面壁开源
清华大学和面壁智能团队开源MiniCPM 4,有8B、0.5B两种参数规模,以22%训练开销达同级别最优。它在架构、推理、数据、训练多方面创新,性能领先,适用于综述生成、工具调用等场景。
一个模型读懂所有医学数据,Hulu-Med探索医学大模型开源新范式 | 浙大x上交xUIUC
Hulu - Med是浙大、上交、UIUC等联合提出的通用医学视觉语言大模型,首次在单一模型统一理解医学多类数据。它开源透明,训练成本低,性能媲美GPT - 4.1,为医学AI带来新范式。
陈丹琦新作:大模型强化学习的第三条路,8B小模型超越GPT-4o
陈丹琦团队提出结合RLHF和RLVR优点的RLMT方法,支持在基础模型上直接使用,节省后训练成本。它让模型生成CoT,用奖励模型评价输出,使小模型超越大模型,推理更像人类。
腾讯开源智能体构建框架
腾讯开源智能体构建框架 Youtu-Agent,灵活高性能,验证性能出色,开源友好成本低。有自动智能体生成等亮点,适用于不同用户群体,涵盖研究、开发等场景,还介绍核心概念,附项目地址。