大模型评估」共找到 9355 篇相关文章

算法论文8

5700问答对全面评估拷问AI空间感!最新空间智能评测基准来了丨浙&成电&港中文

当前视觉语言模型空间信息学习片段化,缺乏多维度空间推理能力。浙、成电和港中文团队提出ViewSpatial - Bench基准体系,评估主流模型,揭示其缺陷,并开发MVSM优化跨视角空间理解。

量子位
新闻资讯7

模型是「躲在洞穴里」观察世界? 强化学习佬「吹哨」提醒LLM致命缺点

加州学伯克利分校副教授、强化学习牛Sergey Levine在博客指出,当前语言模型(LLM)只是对人类脑和思维的间接「扫描」,如同被困洞穴看人类智慧「投影」,无法代替真正思维。

机器之心
产品应用8

比英伟达早,比李飞飞强,晓Kairos原生一体化世界模型定义物理AI新路线

晓机器人发布 Kairos 开悟世界模型,其首创“多模态理解 — 生成 — 预测”原生一体化架构,采用跨具身渐进式训练体系和“以人为中心”的数据金字塔,还实现端侧部署,在四权威具身智能基准上全面登顶。

机器之心
产品应用8

医疗幻觉率比DeepSeek低3倍,百川循证增强模型横扫全球医学考试!

百川智能发布首个循证增强医疗模型Baichuan - M2 Plus,将循证医学理念融入训练和推理,首创六源循证范式。其在多场景评测中幻觉率低,多国医考成绩优异,已上线百小应APP并开放API。

新智元
新闻资讯7

刚刚,模型棋王诞生!40轮血战,OpenAI o3豪夺第一,人类师地位不保?

国际象棋积分赛成果出炉,OpenAI o3以人类等效Elo 1685分夺冠,Grok 4和Gemini 2.5 Pro紧随其后。Kaggle发布国际象棋文本排行榜,评估模型战略推理等能力,还推出相关数据集,虽有局限但意义重

新智元
算法论文8

IEEE TVCG | 告别写代码!MoGraphGPT:基于模块化模型与图形控制的2D交互场景创作

香港多所高校研究团队提出 MoGraphGPT 系统,结合上下文感知模块化模型与图形化控制,能让用户零代码搭建 2D 交互场景。该成果被 IEEE TVCG 录用,还对比实验验证其优势。

机器之心
8

AI真的需要「像人类」那样思考吗?AlphaOne揭示属于模型的「思考之道」

近年模型在推理任务有进展,但缺乏推理节奏调控能力。伊利诺伊学厄巴纳 - 香槟分校和加州学伯克利分校研究提出 AlphaOne 框架,引入 α - moment 实现无需训练的推理调控,实验显示其能提升准确率和效率。

机器之心
产品应用8

1人顶1个Infra团队!OpenAI前CTO新招,让模型训练跌成白菜价

模型训练正从‘作坊炼丹’进化为‘工业微调’。OpenAI前CTO创立的Thinking Machines Lab推出Tinker,潞晨云微调SDK兼容其范式,实现算法设计与基础设施解耦,降低成本,提升人效,适用于多场景。

新智元
产品应用7

Claude Code凭什么牛?模型团队天天用自家产品,发现bug直接就改了

Claude Code虽有争议,但很成功,4个月用户达11.5万。Claude Code负责人透露构建细节,如产品理念、评估标准、反馈机制等,还阐述编程领域变化、模型与工具共同进化等内容。

机器之心
算法论文7

Nature重磅研究:模型让你变得更聪明还是更笨了?创造力增强还是扼杀了?

《自然》研究表明,语言模型对创造力的影响取决于任务。简单任务中,它像灵感助推器,分担认知负荷;复杂任务里,易致‘创意固化’,长期依赖还可能使脑‘变懒’。需按需调节使用。

AIGC开放社区