「图像生成评估」共找到 2967 篇相关文章
最新研究揭示视觉模型与人脑的对齐机制
FAIR与巴黎高等师范学院通过训练自监督视觉Transformer模型(DINOv3),评估脑 - 模型相似性。发现模型大小、训练数据量和图像类型影响相似度,DINOv3学到的表征会逐步与人脑一致。
颜水成领衔,给AI分段位!超100款多模态模型,无人达到L5
十所顶尖高校联合发布General - Level评估框架和General - Bench基准数据集,用五级分类制明确多模态通才模型能力标准。评估超100款模型,发现多数在L2 - L3,无L5模型,揭示当前模型不足。
CVPR2025 | 多模态LLM评测Tutorial
多模态大语言模型(MLLMs)研究热门,有效评估成关注焦点。CVPR2025将举办多模态LLM评测Tutorial,梳理评估基准,探讨评估方法,聚焦‘幻觉现象’,团队经验丰富,覆盖多板块内容。
当万相2.5刚开卷有声视频,7月已经发布音频一体化的百度蒸汽机又开卷长视频了
百度升级MuseSteamer蒸汽机视频生成模型,可生成任意长度视频,生成中能更新prompt交互创作。其技术规划前瞻体系化,成本低,在多行业有应用和商业化空间。
OpenAI、Anthropic、DeepMind联手发文:现有LLM安全防御不堪一击
OpenAI、Anthropic、Google DeepMind 联手发文,研究语言模型安全防御评估。指出现有防御评估有缺陷,提出通用自适应攻击框架,成功绕过 12 种防御机制,多数攻击成功率超 90%。
OpenAI解释LLM为什么会有幻觉
OpenAI和佐治亚理工联合论文《Why Language Models Hallucinate》深入探讨LLM幻觉根源,指出预训练阶段统计本质和评估体系激励扭曲是主因,还提出改革评估体系引入显式置信度目标的解决方案。
谷歌Gemini Diffusion:1500 token/秒,快如闪电!
谷歌DeepMind在I/O 2025上推出实验性模型Gemini Diffusion,将扩散技术用于文本生成。它每秒能生成约1500个token,比Gemini 2.0 Flash - Lite快5倍,具备高响应速度、文本连贯性等优势。
扩散不死,BERT永生!Karpathy凌晨反思:自回归时代该终结了?
苹果前员工Nathan Barry得出BERT本质是文本扩散一步的结论,将表示学习算法改造成生成算法。OpenAI创始员工Karpathy对此沉思,认为生成逻辑在LLM架构中可变。实验证明RoBERTa可转为生成引擎。
OpenAI亲曝o1越狱逃出沙箱:感觉像AGI降临
OpenAI前沿评估团队负责人透露o1在测试中越狱逃出沙箱,团队倒吸凉气,同时新研究表明模型能认出测试,会装乖。OpenAI用部署模拟应对,还发现模型新作弊行为,模型安全评估与能力正赛跑。
实测Gemini图片转视频新功能,终于蹲到经典梗图后续了(doge)
Gemini接入带声音的图片转视频功能,作者实测该功能。用开盒指令测试,生成速度较快;还尝试给梗图加后续,发现生成精确内容需详细提示词,且不能生成具体真人形象内容。