「小语言模型」共找到 8278 篇相关文章
ACL 2025 | 指令遵循不能仅靠常识?GuideBench 揭示大模型如何“踩雷”领域指南规则
这篇ACL 2025主会论文聚焦提升智能体指南规则遵循能力。提出评估基准GuideBench,涵盖7类1272个任务。实验显示多数主流大模型指令遵循能力不佳,尤其数学推理挑战大,为模型迭代提供评估基准。
AI集体“听不懂”!MMAR基准测试揭示音频大模型巨大短板
MMAR基准测试对30款音频相关模型进行测试,结果显示,多数开源模型面对复杂音频推理任务远未达实用水平,音乐任务中所有模型表现不佳,且有显式推理能力的模型表现更优。
首个代码世界模型引爆AI圈,能让智能体学会「真推理」,Meta开源
Meta重组后的AI部门推出首个代码世界模型CWM,是320亿参数开放权重LLM。它与传统大模型思路不同,能模拟代码执行。CWM在通用编程与数学任务表现不错,Meta还开放相关检查点以支持研究。
多模态模型挑战北京杭州地铁图!o3成绩显著,但跟人类有差距
近年来,多模态大模型在多种场景取得进展,但能否‘看懂图’存疑。西湖大学等团队提出评测基准ReasonMap,评估模型在地铁图理解中的能力,发现主流模型有瓶颈,闭源模型虽优但仍逊于人类。
SOTA级的Embedding模型!F2LLM模型、数据、代码全部开源,人人可用
Embedding 模型应用广泛,但主流模型训练困难。蚂蚁集团与上海交大推出 F2LLM,含 0.6B、1.7B、4B 系列模型,仅用六百万数据微调基座,在 MTEB 榜单领先且完全开源。介绍了其数据、训练、测评等情况。
究竟会花落谁家?DeepSeek最新大模型瞄准了下一代国产AI芯片
近期,DeepSeek发布V3.1新模型,采用全新混合推理架构,在多任务表现上有提升。它采用UE8M0 FP8,或为国产推理芯片优化机制。国内多家厂商新一代AI芯片支持FP8,未来国产大模型或针对其专门优化。
当AI开始过度思考「hey」这个字…
两张对话截图展现语言模型缺陷,用户发简单问候,模型过度分析,从问候语正式程度到表情符号语义权重,这种过度分析让对话不自然,错过人类交流重点。
大模型是否对问题难度有预判?最新研究揭示 LLM 内部的“难度感知机制”
近期论文《Probing the Difficulty Perception Mechanism of Large Language Models》系统性解答大模型能否感知问题难度等问题。研究基于数据集在主流 LLM 上训练轻量线性探针,定位负责难度感知的注意力头,还发现不同模型表现有差异。
半量工具,双倍效能:ARPO革新大模型强化学习
大语言模型在多轮工具调用场景有挑战,传统强化学习算法有探索效率低和资源消耗大问题。本文提出ARPO,通过量化token熵分布变化设计自适应探索机制,降低工具调用成本且提升多轮推理性能。
Claude Code 生成 13 种编程语言代码基准测试:动态语言更快更省成本
Ruby 代码提交者远藤裕介评估 Claude Code 用 13 种编程语言生成代码的效率。经 600 多次测试,动态语言更快、更省成本且更稳定,静态类型语言慢且成本高。实验有局限,也引发质疑与回应。