大模型评测」共找到 9255 篇相关文章

算法论文8

首次!AI智能体破解「纳什均衡」,模型学会博弈论|Cell子刊

多所高校研究团队开发出PrimeNash语言模型智能体框架,能自动推导纳什均衡闭式解析解并生成证明。它模拟人类科研路径,分三模块求解,经经典博弈验证,还在碳市场博弈展现应用潜力。

新智元
开源动态8

月之暗面刚开源多模态Kimi-2506:智能体、视觉理解,重磅升级

国内月之暗面平台对开源多模态模型Kimi-VL-A3B-Thinking升级到2506版本。该版本性能、视觉理解等能力提升,支持更高分辨率,在多领域表现出色,还介绍了模型组成与优化器改进。

AIGC开放社区
新闻资讯7

投资人不再只看模型?AI资本新逻辑揭秘|甲子引力X

2025年AI投资进入新阶段,模型竞赛趋理性,AI Agent等赛道加速发展,投资逻辑重构。甲子引力X圆桌对话中,六位投资人分享投资逻辑调整、新投企业及看法,探讨具身智能、物理AI落地等问题。

甲子光年
新闻资讯7

GPT-5.6紧急叫停!OpenAI最强模型被迫「一客一审」

因网络安全考量,OpenAI最强模型GPT-5.6被紧急叫停,进入「逐个审批」时代,先有限预览,客户访问权限逐一审批。开发者已发现其相关代码,它在前端UI设计等方面实力涨,但发布开关被拿走。六月三旗舰模型集体卡壳。

新智元
新闻资讯7

Claude Opus 4.1代码实测惊人!OpenAI开源模型却只会写屎山?

昨日,OpenAI、谷歌和Anthropic等发布新模型。Anthropic推出Claude Opus 4.1,虽性能提升不,但编码能力获客户认可。实测显示Claude - Opus - 4.1写代码稳,OpenAI新模型表现不佳。

新智元
开源动态8

最新W4A4KV4全量化框架,单卡A100模型推理速度飙升

计算所王颖研究员团队等联合在ASPLOS 2025上发表并开源COMET框架,通过系统 - 算法协同优化,实现全4比特推理性能突破,在多方面有技术亮点,实测性能碾压现有方案且已开源。

AIGC开放社区
新闻资讯7

谷歌市值突破3万亿!重利好力推股价

谷歌母公司Alphabet股价周一涨,市值首破3万亿美元,成全球第四家达此成就的公司。近期谷歌反垄断案落定避免拆分,且其模型表现优异,驱动多业务转型,投资者信心增。

新智元
算法论文8

模型训练的不稳定性有望彻底解决,MIT新研究用谱正则化替代层归一化

MIT团队创造Lipschitz Transformer,用谱正则化替代层归一化,认为或解决训练不稳定根本原因。他们对比多种方法权衡,发现Muon + 奇异值裁剪推动权衡边界,且工作完全开源。

AGI Hunt
新闻资讯7

Cursor滑跪开源技术报告:Kimi基模这样微调能干翻Claude

Cursor放出Composer 2技术报告力证‘自研’,基于Kimi K2.5经持续预训练和异步强化学习,测试表现好。同时,杨植麟分享Kimi团队最新思考,认为模型要规模化,断言模型训练进入第三阶段。

量子位
算法论文7

老牌Transformer杀手在ICLR悄然更新:Mamba-3三改进趋近设计完全体

Transformer架构仍是AI主流,Mamba作为挑战者影响力。Mamba-3在ICLR 2026盲审,有梯形离散化、复数化状态空间模型、多输入多输出状态空间模型改进,实证表现佳,适合多场景。

机器之心