「评测机制」共找到 1466 篇相关文章
国产开源大模型:再见9月,你好10月~
9月国产大模型持续开源,涉及DeepSeek、Qwen、百度等。如DeepSeek-V3.1缓解语言问题、优化Agent能力;阿里Qwen系列开源超10个模型;百度Qianfan-VL增强领域能力等。还展望10月新模型开源。
不等风来,要做风的源头:海淀孵化器新政以“场域孵化”催生创新范式跃迁 | 甲子光年
在全球经济与科技变革背景下,孵化器正经历范式重塑。海淀出台《海淀区高质量孵化器政策》,构建“创新策源场”,通过“源头激活”“垂直深耕”“生态协同”引领行业升级,助力创新发展。
谷歌Nano Banana全网刷屏,起底背后团队
谷歌开发者节目展示了Gemini 2.5 Flash Image模型,它能快速生成高质量图像、保持场景一致。文中起底背后团队成员,还介绍模型技术亮点、与Imagen对比及未来能力展望。
突破长视频生成瓶颈:南大、TeleAI推出全新AI生成范式MMPL,让创意一镜到底
当前AI长视频生成面临质量骤降、细节崩坏、生成低效等问题。南京大学联合TeleAI推出MMPL新范式,首创“宏观规划、微观执行”双层生成架构,实现分钟级高质量长视频稳定生成,效率显著提升。
大模型如何推理?斯坦福CS25重要一课,DeepMind首席科学家主讲
Google DeepMind首席科学家Denny Zhou在斯坦福CS25课程分享大语言模型推理见解,总结了四个关键点,阐述推理机制、优化方法及最新进展,还介绍多种推理方法并比较其优劣。
首个开源多模态Deep Research智能体,超越多个闭源方案
首个开源多模态Deep Research Agent登场,整合多种工具并优化决策。其WebWatcher技术方案覆盖全链路,实验中在四大核心领域领先主流模型,展现复杂推理和信息检索实力。
GUI定位还在玩「非黑即白」?浙大团队提出GUI-G²,显著提升GUI智能体定位性能
在人工智能领域,GUI 智能体成技术风口,但现有 GUI Grounding 方法有缺陷。浙大团队提出 GUI - G²,将 GUI 交互转变为连续空间建模,在三个主流 GUI 定位基准测试中表现亮眼,重新定义了 GUI 交互本质。
首次结合RL与SFT各自优势,动态引导模型实现推理⾼效训练
新一代大型推理模型在复杂推理有进展,核心是ZERO - RL训练法。华为香港研究所小艺团队等合作推出GHPO算法框架,融合在线强化学习与模仿学习,解决了RLVR方法局限,提升模型训练效果,代码数据开源。
告别评估乱象!首个视觉解释综合性基准发布,附人类真值 | KDD'25
埃默里大学团队推出首个视觉解释基准Saliency - Bench,构建8个任务的数据集,提供标准化评估流程与开源工具包,解决评估缺乏标准等问题,推动可解释AI向可靠、透明发展。
高考数学斩获139分!小米7B模型比肩Qwen3-235B、OpenAI o3
2025高考落下帷幕,人工智能领域多家大模型挑战数学卷。小米7B参数的MiMo - VL模型考139分,比肩Qwen3 - 235B、OpenAI o3,还在多方面表现出色,技术报告等已开源。