「VL - LN Bench」共找到 237 篇相关文章
阿里Qwen又悄悄放出8个开源权重,卷疯了~
阿里通义千问太卷,悄悄放出8个开源模型权重,包括体积更小的Qwen3-VL及FP8权重。这一代实现全方位升级,提供两种架构、两个版本,架构也有更新,还给出使用示例与模型权重链接。
成功率最高暴跌36.9%!南洋理工首个“模糊指令”测试,直击具身智能落地软肋
南洋理工大学MARS Lab团队联合发布测试基准REI-Bench,量化现有具身智能大模型缺陷。在其测试下,主流任务成功率最高降36.9%。研究还剖析错误原因,给出解法,望引起学界重视。
字节发了个机器人全能大模型,带队人李航
字节推出Seed,其Robix视觉—语言单模型能搞定机器人推理、任务规划和自然语言交互,核心采用思维链推理和三阶段训练策略,效果超Qwen2.5 - VL、GPT - 4o等,负责人是李航。
Jina 第4版:多模态向量检索,统一适配,挑战3大任务
Jina第4版基于Qwen2.5 - VL模型扩展,支持单向量和多向量输出。它经对比学习和任务特化训练,推理时可按需选LoRA适配器,能利用多模态处理能力优化不同任务性能。
ICML 2026|让AI自动发现前沿风险:创智×复旦×牛津发布AutoControl-Arena
当AI智能体走向真实应用,前沿风险藏于复杂长尾场景,难以靠人工覆盖。创智、复旦、牛津联合发布AutoControl Arena框架,自动合成可执行测试环境,还构建X - BENCH验证,已在GitHub开源。
ICCV 2025 | 机器人自主探索未知复杂空间?GLEAM破解主动探索建图的泛化难题
文章聚焦机器人在未知复杂空间的自主探索建图难题。香港中文大学与上海人工智能实验室联合提出GLEAM,搭建GLEAM - Bench基准,设计通用策略,实现零样本适配未知空间,在多指标上超越先前方法。
让视频搜索像聊天一样简单!本地也能跑的视频语义搜索工具
SentrySearch是基于语义的视频搜索工具,输入文字描述就能从视频中找到对应片段并剪辑成短视频。它可借助Google Gemini Embedding API或本地Qwen3 - VL模型,还适配特斯拉行车记录仪,能叠加车速等信息。
告别评估乱象!首个视觉解释综合性基准发布,附人类真值 | KDD'25
埃默里大学团队推出首个视觉解释基准Saliency - Bench,构建8个任务的数据集,提供标准化评估流程与开源工具包,解决评估缺乏标准等问题,推动可解释AI向可靠、透明发展。
这个春节P图不求人!小红书开源图像编辑新SOTA
今日小红书基础模型FireRed - Image - Edit亮相,在复杂编辑指令、风格化转换等核心指标表现强,在多项权威测试达SOTA。该项目代码等已开源,模型权重将开源。团队还推出RedEdit Bench评测方案。
不换模型,效果提升104%!上海AI Lab让Harness也能自进化了
上海人工智能实验室团队提出的Self-Harness引发关注,它针对Agent外层Harness改进。实验显示,在Terminal-Bench-2.0上,不换模型只改Harness,Qwen3.5-35B-A3B等模型效果显著提升。