「路由评测」共找到 697 篇相关文章
360发布全球最强视觉语言对齐模型!榜单全面领先!
360发布FG - CLIP 2双语细粒度视觉语言对齐模型,几乎在所有数据集上全面领先。它能让AI在统一框架内看懂图像细节、理解中英双语,团队还提出新中文多模态评测基准。
哈佛发现基础模型比你想象中更强大:纯采样方法可超越RL
论文提出基础模型本身已具备强大推理能力,通过“幂采样”纯采样算法,在多推理任务上媲美或超越RL后训练,挑战“RL才能提升推理”观念,为理解基础模型潜力开新视角。
AIME'25满分炸场!Qwen一波七连发,全家桶大更新
云栖大会上,通义团队成果丰硕。Qwen3-Max性能提升,数学评测满分,多测试成绩优异;Qwen3-VL、Qwen3-Omni等开源,各有亮点;Qwen3-Coder升级。吴泳铭称要发展超级人工智能。
苹果传统强项再发力,视觉领域三种模态终于统一
苹果在大模型领域常受挫,但计算机视觉研究是其强项。其研究团队提出 ATOKEN,这是首个能在主要视觉模态统一处理的分词器,兼顾重建质量与语义理解,成果朝通用视觉表征迈进一步。
o3 Gemini 都翻车?首个可验证长链 GUI 数据集 VeriGUI 重磅开源,探索通用 Agent 能力边界
GUI 智能体发展遇瓶颈,现有数据集难评估其长时程规划能力。2077AI 开源基金会牵头构建的 VeriGUI 应运而生,有长链复杂性与子任务级可验证性特征,论文登 Hugging Face 月榜第三,还证明现有模型瓶颈。
豆包 AI 编程:一句话写赛博鱼缸,动嘴皮改富士滤镜
豆包发布全新模型 1.6 后,AI 编程更新,基于此模型在评测集位列第一梯队。它实现低门槛+可用性,能一句话生成网站、工具,还可可视化编辑,目标是让普通人能做产品。
全球首个历史基准!普林复旦打造AI历史助手,AI破圈人文学科
普林斯顿大学AI实验室与复旦大学历史学系联手推出全球首个历史领域评测基准HistBench及AI助手HistAgent。HistBench含414道题,能检验AI深度认知能力;HistAgent集成多种工具,在测试中表现优异。
字节开源DreamO,一个框架包揽多种图像定制需求
近期图像定制研究展示大规模生成模型潜力,但多数方法通用性有限。字节提出DreamO框架,支持多种图像定制任务,有特征路由约束机制,能解决特征冲突,还介绍其技术原理与各任务效果。
Grok Bot代码也泄露了?
8月23日X上有人称Cursor团队发布的Grok Bot 0.18.0,runtime source map是开着的,此人重构其客户端代码并放于GitHub,一天浏览量约88万。该重构项目有诸多实用实验和功能。
搜索智能体也需要「操作系统」:SearchOS 开源多智能体协作框架
人大和蚂蚁的 SearchOS 研究,给出搜索智能体在长程任务中问题的答案。它借鉴数据库理念,做了多项核心设计,在开放信息检索基准评测领先,已提供多种使用方式,值得长程调研尝试。