「视觉基准测试」共找到 2534 篇相关文章
开源Agent新标杆:通义WebSailor多榜夺魁,挑战OpenAI高难度Agent基准BrowseComp
信息爆炸时代,传统搜索引擎难满足需求,开源Web Agent在极端复杂任务表现不佳。阿里巴巴通义实验室推出WebSailor,通过创新数据构造和训练方法,在BrowseComp等挑战上取得突破,缩小与顶级封闭系统差距。
月之暗面刚开源多模态Kimi-2506:智能体、视觉理解,重磅大升级
国内月之暗面平台对开源多模态模型Kimi-VL-A3B-Thinking升级到2506版本。该版本性能、视觉理解等能力提升,支持更高分辨率,在多领域表现出色,还介绍了模型组成与优化器改进。
真实科研水平集体不及格!全新基准SFE给主流多模态LLM来了波暴击
上海人工智能实验室AI4S团队推出SFE评测基准,首创三级评估体系,涵盖五大科学领域66项任务。评测显示主流MLLMs在高阶科学任务有挑战,不同模型、学科表现有差异,还构建了SciPrismaX平台推动AI科学评估生态发展。
AI 开发时代的“能力暴露与禁止空间”方法论:TPDD 与高层测试闭环
文章指出大模型加速软件开发范式演进,AI 深度介入开发带来新生产路径,但也放大风险。作者提出 TPDD 方法论,通过提前定义测试点与边界条件,平衡能力利用与风险控制,确保系统可控、安全、可持续。
Meta出走华人创业团队,种子轮800万美元,要打造视觉AI记忆大脑
由前Meta顶尖科学家创立的Memories.ai获800万美元种子轮融资。其大视觉记忆模型LVMM解决AI‘记忆缺失’问题,在多领域刷新SOTA基准,应用潜力大,还开放API及网页应用。
迈向原生全模态AI智能体:人大&小红书发布OmniGAIA新基准
中国人民大学等团队推出 OmniGAIA 新基准及 OmniAtlas 训练框架。OmniGAIA 含 360 个高难度任务,覆盖多领域。实验显示闭源与开源模型差距大,OmniAtlas 显著提升开源模型表现,并指出未来全模态智能体发展方向。
Stream-Omni:同时支持各种模态组合交互的文本-视觉-语音多模态大模型
中国科学院计算技术研究所团队提出文本-视觉-语音多模态大模型Stream-Omni,能支持多种模态组合交互。它对各模态关系针对性建模,实现高效灵活的模态对齐,仅用少量语音数据就有多种交互能力。
真实评估!北理发布全球首个「全场景教育」基准,支持4000+情境
北京理工大学高扬老师团队推出EduBench,是全球首个「全场景教育」基准,涵盖9大教育场景、12个评估维度、超4000个情境。团队将数据、模型等全面开源,评估发现大模型在特殊教育场景有不足,还提出多源知识蒸馏等方法。
腾讯纯文本LLM训视觉encoder,拿捏图表长视频,达到开源小模型SOTA!
腾讯开源Penguin - VL,直接用纯文本LLM训视觉编码器,跳出传统多模态拼接套路。在2B/8B紧凑参数规模的复杂任务中竞争力强,训练分三阶段,相关代码、模型等已开放。
生成率从8%到60%:快手智能测试用例生成系统的四阶进化
快手研发效能团队构建智能用例生成系统,实现从手动编写到审核校验的模式转变。该系统历经四阶架构演进,将用例生成率从 8% 提升至 60% 以上,成为公司测试人员日常使用的标准化生产力工具。