「视觉基准测试」共找到 2534 篇相关文章
视觉生成的另一条路:Infinity 自回归架构的原理与实践
本文整理自字节跳动韩剑在AICon 2025北京站的分享,以Infinity为例介绍自回归视觉生成原理,对比其与扩散模型,展示Infinity升级方案成果,它在高分辨率文本到图像任务能与扩散模型竞争。
突发!曝阿里通义薄列峰离职,此前为应用视觉团队负责人
五一节后爆料阿里通义实验室应用视觉团队负责人薄列峰于4月30日离职。他曾带领团队做出爆款功能,现加入某互联网大厂。今年2月语音团队负责人鄢志杰也已离职,接替人选均成谜。
OpenClaw爆火,暴露12类致命隐患!MCP协议安全基准发布 | ICLR
OpenClaw等开源AI Agent项目爆火,MCP协议拓宽其能力也增大攻击面。北京邮电大学团队推出MSB安全基准,揭示MCP各阶段攻击有效,性能强的模型更易受攻击,还提出NRP指标平衡安全与实用性。
多模态幻觉的病因「高熵节点」找到了!全基准幻觉率下降
多模态大推理模型的幻觉常出现在生成转折词时,此时模型处于高熵关键节点,易脱离图像证据。研究者提出LEAD,高熵时保留候选推理方向,注入视觉锚点拉回证据,实验显示它能跨领域提升模型性能。
Anthropic、Thinking Machines Lab论文曝光:30万次压力测试揭示AI规范缺陷
Anthropic和Thinking Machines Lab等机构研究人员提出模型规范压力测试法,基于细粒度价值体系生成超30万个查询场景,分析12个前沿大模型回答,揭示模型规范存在原则冲突、解释歧义等缺陷。
我们测试了百度的「AI 科学家」,它正在悄悄淘汰算法工程师
百度 2025 世界大会亮相的「伐谋」,是全球领先可商用自我演化超级智能体。它源于进化论,能让算法自我进化。实测显示其在生活场景和复杂决策问题上表现优越,架构精巧,将推动算法研发普惠化。
真实音频场景,大模型集体挂科!首个原生语音基准MultiChallenge
Scale AI发布首个原生音频多轮对话基准Audio MultiChallenge,撕开大模型靠合成语音评测维持的假象。实验显示,Gemini 3 Pro等模型在真实场景表现不佳,还揭示了模型在语音交互中的三大失败模式。
视觉模型既懂语义,又能还原细节,南洋理工&商汤提出棱镜假说
南洋理工与商汤团队提出 Prism Hypothesis(棱镜假说)与 Unified Autoencoding(UAE)。论文指出视觉基础模型中语义理解和像素保真很难兼得,用频率谱统一视角解决冲突,UAE 实验效果良好。
浙大校友打造AI代码测试神器,零代码零bug,30分钟创建网站
浙大校友打造的智能测试平台TestSprite 2.0,零代码零bug,30分钟创建网站,能让AI写代码准确率从42%跃升至93%,还可自动生成测试报告、调试修复错误,全程无需人工干预。
拒绝「盲修」:JarvisEvo 如何让 Agent 像人类一样拥有「视觉反思」能力?
现有 Image Editing Agent 缺乏视觉反馈,易致「指令幻觉」和 Reward Hacking。JarvisEvo 应运而生,它通过 iMCoT、SEPO、On - Policy Reflection 等技术,结合 ArtEdit 数据集和三阶段训练,在修图上表现出色,意义超图像编辑。