「大模型测试」共找到 9649 篇相关文章
OpenAI解密大模型失控:它不是变坏,而是「太听话」
OpenAI公开IH - Challenge,解决大模型指令冲突难题。指出大模型问题多因听信错误指令,给出系统>开发者>用户>工具的指令层级结构,设计数据集训练模型遵循高信任等级指令,提升安全可控性与抵御提示词注入能力。
大模型化身苏格拉底:通过主动提问挖掘人机协作的深度
微软与南加州大学联合团队研究揭示激发大模型主动提问能力新范式。通过定义主动信息收集任务、提出强化微调策略,经实验验证该方法有效,使模型在多领域表现出色,重新定义大模型角色。
大模型刷数学题竟有害?CMU评估20+模型指出训练陷阱
CMU团队评估20多个大模型,发现只有强化学习(RL)训练的模型能将数学推理技能广泛迁移到其他任务,监督微调(SFT)训练的模型迁移有限甚至无迁移。研究还探索差异原因,表明RL微调更具优势。
句子级溯源+生成式归因,C²-Cite重塑大模型可信度
在人工智能发展背景下,大模型内容可信度成焦点。北邮百家AI与小米团队提出溯源大模型C² - Cite,首创上下文感知归因生成技术,解决现有归因模型缺陷,已被WSDM 2026收录。
真实音频场景,大模型集体挂科!首个原生语音基准MultiChallenge
Scale AI发布首个原生音频多轮对话基准Audio MultiChallenge,撕开大模型靠合成语音评测维持的假象。实验显示,Gemini 3 Pro等模型在真实场景表现不佳,还揭示了模型在语音交互中的三大失败模式。
MiniMax-M1:全球首个开源超长上下文大模型,超越DeepSeek-R1,推理成本仅1/4
MiniMax-M1是全球首个开源超长上下文大模型,刷新三项记录。它采用混合专家架构,闪电注意力让推理复杂度近乎线性增长。CISPO算法加速训练,成本低。在工业级任务测试表现佳,已开源且方便开发者接入。
【万字长文】大模型训练推理和性能优化算法总结和实践
本文总结大模型落地的训练、推理和性能优化算法与实践,介绍语言模型发展,对比BERT、GPT等训练方式,分析生成式大模型问题,还阐述数据处理、推理优化及训练调优等内容,并给出不同场景技术选型建议。
推理效率狂飙60倍:DiDi-Instruct让扩散大模型16步超越千步GPT
普渡大学等研究者提出 DiDi-Instruct 后训练方法,可将扩散大语言模型推理加速 60 倍,超越传统 GPT 模型。该方法实现推理效率与效果双提升,为大语言模型落地提供新方案。
国产开源大模型:再见9月,你好10月~
9月国产大模型持续开源,涉及DeepSeek、Qwen、百度等。如DeepSeek-V3.1缓解语言问题、优化Agent能力;阿里Qwen系列开源超10个模型;百度Qianfan-VL增强领域能力等。还展望10月新模型开源。
杨植麟当主持人的大模型圆桌:张鹏罗福莉夏立雪都放开说了
中关村论坛上,杨植麟、罗福莉、张鹏、夏立雪、黄超齐聚,共论agent的下一代演进。各位大咖观点硬核,如罗福莉认为中国大模型团队优势在‘算力受限下的最优解能力’,张鹏解释智谱新模型涨价原因等。