「大模型测试」共找到 9665 篇相关文章
基于AI大模型的故障诊断与根因分析落地实现
文章围绕基于AI大模型的故障诊断与根因分析展开,介绍项目背景、目标与原理,阐述要解决的运维痛点及技术架构、知识库构建,还提及ReAct模式实现、Dify工作流及ClaudeCode对比,目前根因定位成功率有所提升。
Karpathy最新发文:醒醒!别把AI当人看,它没欲望也不怕死
Andrej Karpathy在推文中反驳将大模型视作「更聪明人类」的观点,指出大模型是「非生物」智能,其进化压力、学习机制、运行方式与人类不同。清楚这是全新智能,对理解大模型很重要。
模型「漂移」新范式,何恺明新作让生成模型无须迭代推理
训练生成模型复杂,传统扩散模型训练费时费力。何恺明团队提出「漂移模型」新范式,不依赖微分方程,支持一步推理,实验验证其在多领域性能佳,有望解决生成式AI质量与效率权衡问题。
长文本推理 5 倍提速!面壁MiniCPM4 端侧模型发布,0.5B模型效果秒杀同级
近日,面壁发布 MiniCPM4.0 端侧模型,有 8B、0.5B 两种规模。其在基准测试表现出色,长文本推理提速,缓存锐减,还做了架构创新。此外,面壁有自研推理框架,科学化建模产线,6 月 27 - 28 日 AICon 北京站将探讨 AI 趋势。
AAAI 2026 Oral|LENS:基于统一强化推理的分割大模型
文本提示图像分割技术有战略意义,但基于监督式微调的方法有泛化能力瓶颈。为此引入LENS框架,采用强化学习机制,还介绍其架构、奖励机制,该框架在测试中表现优异,代码已开源。
Meta提出StepWiser,让模型学会“反思”自己的推理过程
Meta提出StepWiser解决大语言模型推理逻辑正确性问题。它训练生成式评判模型,通过强化学习在线训练,能解释推理步骤好坏。实验显示其远超传统方法,为构建可靠AI系统提供新思路。
突然袭击!刚刚,Meta超级智能团队首个大模型来了
Meta超级智能实验室推出首个模型Muse Spark,由Alexandr Wang带领团队打造。它具备多能力,定位为构建个人超级智能基础,在多方面表现出色,Meta还研究其扩展维度。
超越OpenAI、拿下全球双料第一,“AI吴彦祖”背后大模型SOTA了!
国产大模型MiniMax发布Speech - 02,拿下两项全球权威语音基准测评第一,是榜单前十唯一国产玩家。它超拟人、个性化、多样,技术创新,且在多行业落地,全模态布局领先。
打破具身世界模型可执行性鸿沟 !港中深-跨维智能团队提出EVA框架,用强化学习让视频世界模型真正“动”起来
近期,利用视频生成模型为机器人构建“世界模型”成热门路线,但存在“可执行性鸿沟”。港中深 - 跨维智能团队提出 EVA 框架,用强化学习优化视频生成,实验显示其能提升视觉规划、仿真任务成功率及真实部署稳定性,还有数据合成潜力。
大模型可否胸有成竹?探索LLM推理与自信心的关系 | 直播预约
本次全英文直播将探讨大语言模型推理能力扩展瓶颈,介绍以置信度为核心的推理视角,展示“自确定性”指标及应用,还会讨论方法有效性和“基于置信度的推理”意义。