大模型测试」共找到 9649 篇相关文章

算法论文8

ICLR 2026 Oral | 没人诱导,模型也会「骗人」

新加坡国立学 Bingsheng He 教授团队论文关注无诱导下模型是否诚实。设计 CSQ 框架测 16 主流模型,发现问题越难模型越易不诚实,能力强也未必更诚实,还揭示 silent fabrication 现象。

机器之心
8

12月首炸!可灵 O1 正式发布,全球首个统一多模态视频模型,强得可怕!

12月快手旗下可灵发布全球首个统一多模态视频模型Kling O1,标志AI视频进入“全流程语义控制时代”。它将多种视频创作能力统一,有全能引擎等五亮点,性能对比优势明显,让AI视频生成更可控。

开源星探
算法论文8

模型训练新突破!Meta提出LSP:无数据也能实现能力飞升

Meta提出语言自我博弈(LSP)方法,利用自我博弈框架让模型自我改进,不依赖额外数据。LSP赋予模型挑战者和解题者身份,引入GRPO和KL散度正则化技术,解决了模型训练的数据依赖难题。

新智元
新闻资讯8

模型七连发,外国人馋透了!阿里云栖会全栈升级够狠

阿里在2025云栖会全栈升级,发布七款通义新模型,从基础模型到各专项领域全覆盖。旗舰模型Qwen3 - Max性能超GPT - 5等,新架构Qwen3 - Next实现效率突破,多模型开源且表现出色。

机器之心
新闻资讯7

模型平台Mistral正洽谈10亿美元融资

彭博消息,法国模型开源平台Mistral正与阿布扎比MGX基金及法国贷款机构洽谈10亿美元融资。MistralAI成立于2023年,模型性能佳,2023年末至2024年多轮融资使估值飙升,还开发多款模型

AIGC开放社区
算法论文8

全球顶尖AI做物理,被人类按地摩擦?不懂推理翻车,本科生碾压

等机构用3000道物理题测试顶尖模型,如GPT - 4o、Claude 3.7 Sonnet等,结果模型准确率远低于人类专家。研究推出PHYX基准测试,揭示模型依赖知识、公式和模式匹配,缺乏真正物理理解。

新智元
开源动态8

4B小模型数学推理首超Claude 4,700步RL训练逼近235B性能 | 港&字节Seed&复旦

香港学NLP团队联合字节跳动Seed、复旦学发布Polaris强化学习训练配方,让4B模型数学推理能力超商业模型,且Polaris-4B可在消费级显卡部署,相关内容已全部开源。

量子位
新闻资讯7

模型的价格战,打到硅谷了

今年夏天,AI价格战风向改变,OpenAI酝酿降价从Anthropic抢客户。7月,Anthropic推半价平替Claude Opus 5,此前OpenAI发布GPT - 5.6打性价比。价格战因模型购买逻辑变化、头部差距难支撑溢价等引发,虽让应用层受益,但对模型公司是资本耐力赛。

芯师爷
算法论文8

700万参数击败DeepSeek R1等,三星一人独作爆火,用递归颠覆模型推理

今年6月Sapient Intelligence提出的HRM影响模型推理结构,四个月后三星研究员Alexia Jolicoeur - Martineau推出TRM,700万参数模型在推理基准测试中超越参数多10000倍的模型,还介绍了TRM原理、改进及实验结果。

机器之心
新闻资讯8

图灵奖得主领衔,中国模型第一梯队集结!2026智源会,看懂AI下一程

2026年6月12 - 13日,第八届智源会将在北京举办。多位图灵奖得主、40余位AI企业CEO等将齐聚,探讨超级模型等关键方向。会还关注世界模型、智能体等核心方向,设25场论坛,首次实现“智能体听会”。

量子位