大语言模型评估」共找到 8218 篇相关文章

推荐文章7

中学生就能看懂:从零开始理解LLM内部原理【十三】|GPT 架构如何工作 ?

本文是对GPT架构工作原理的解读。介绍了GPT与Transformer的关系,阐述其从输入文本到预测下一词概率的流水线,详述训练和推理流程,还提及GPT架构进化的混合专家(MoE)模型

AI大模型应用实践
新闻资讯7

刚刚,Anthropic发布Sonnet 5,性能接近Opus 4.8,但不一定更便宜

Anthropic发布Claude Sonnet 5,称其为最具Agent属性的Sonnet模型。它在推理等方面性能提升,接近Opus 4.8且价格低。安全评估有改善,但网络安全逊于Opus 4.8。已正式可用,有优惠首发价。

机器之心
产品应用8

ChatGPT Images 2.0震撼发布!碾压谷歌Nano Banana,设计真要完了

北京时间凌晨3点,OpenAI发布ChatGPT Images 2.0,是先进模型,能处理复杂视觉任务。它精度控制力高、多语言能力强,风格表达成熟,支持多种宽高比,有现实世界理解能力等,已向相关用户开放,但也有局限性。

机器之心
算法论文8

超越MLA!新架构MLRA百万token,解码最高2.8倍速 | ICLR'26

语言模型处理长文本时,自回归生成受限于显存带宽。为减少KV缓存开销,业界尝试多种方法,但MLA有缺陷。宾夕法尼亚州立大学等研究人员提出MLRA,拆分KV缓存为四个并行分支,降低显存占用,实现4路张量并行,性能更优。

新智元
算法论文8

Temperature Scaling可大幅提高Test-Time Scaling瓶颈!

大型语言模型解决复杂推理问题时,测试时扩展(TTS)是提升性能的途径之一。但传统TTS依赖增加样本数量,性能提升有瓶颈。本文提出温度缩放新思路,实验表明其能大幅提升性能,还给出降低成本方法。

深度学习自然语言处理
产品应用8

奥特曼亲自上阵,Images 2.0登顶王座!大米刻字,生图跨入GPT-5时代

OpenAI上线ChatGPT Images 2.0,奥特曼称其是从GPT - 3到GPT - 5的飞跃。它是首个‘会思考’的图像AI,能精准听懂中文指令、渲染复杂UI,在Arena榜单登顶,解决了多语言、风格等痛点。

新智元
推荐文章8

AI三问:Agent、LLM、RAG,一文厘清!

文章介绍大语言模型(LLM)、检索增强生成(RAG)和AI智能体(Agent)三种架构。阐述其概念、工作原理、应用场景、优缺点,还做了横向对比,给出选用建议,最后提及混合架构与未来趋势。

MCP Lab
算法论文7

让AI创作不千篇一律,提示词随机插词汇就行

最新研究发现,在AI开写前由人类提供开头或随机插入词汇,写作效果会更多样,AI写作同质化或因“启动条件”问题。研究创建三类同质化评价指标,还发现向系统提示注入随机词汇可提升模型输出多样性。

量子位
算法论文7

从数据分布视角,重新认识下CoT

本文从数据分布视角重新审视大语言模型的思维链(CoT)推理。指出CoT并非真正推理,而是模仿,其效果受训练与测试分布差异影响。通过实验揭示CoT在分布偏移时性能退化,提醒勿过度依赖。

深度学习自然语言处理
推荐文章8

从检测到通用感知:构建空间智能的基础

本文整理自张磊在AICon 2025北京的分享,分析语言与视觉原生模型架构区别,介绍基于Transformer的物体检测算法及开集检测技术进展,如Grounding DINO和DINO - X,还探讨其在多领域的应用和潜力。

InfoQ