模型透明化」共找到 8182 篇相关文章

算法论文8

警惕!大模型成本倒挂:你正在为模型的多余「思考」买单

一项来自多所高校和微软研究院的研究揭示AI模型价格倒挂现象,低定价模型可能产生更高实际开销。研究聚焦8个前沿推理模型和9个主流数据集,指出推理token是成本倒挂主因,且实际开销难以预测。

机器之心
新闻资讯7

“通用大模型微调成为行业模型是伪命题”?医疗 AI 深度重构,传神语联创始人何恩培:孪生智能体能砍 70% 线下复诊工作

本文为《2025年度盘点与趋势洞察》系列内容,传神语联创始人何恩培认为通用大模型微调成行业模型是伪命题。他表示孪生智能体能砍70%线下复诊工作,还分享了医疗AI发展、中医和西医落地方向及突破方向等见解。

AI前线
新闻资讯7

Ilya的第一个模型,被曝本月上线

新智元报道,投资人Gavin Baker称Ilya Sutskever创立的SSI本月将发布首个模型。他还提及持续学习等技术或影响英伟达显卡需求,且指出Claude成华尔街“克朗凯特”,带来市场共识同质

新智元
算法论文7

Meta全开源HumanCLAW:基础模型正进入具身智能的决策层

过去基础模型主要理解和描述物理世界,如今开始进入机器人控制栈。Meta等提出HumanCLAW,将高层行动与低层运动控制分开。评测显示当前模型在行动决策上存在不足,未来可从多方向推进研究。

机器之心
算法论文8

模型训练的不稳定性有望彻底解决,MIT新研究用谱正则替代层归一

MIT团队创造Lipschitz Transformer,用谱正则替代层归一,认为或解决训练不稳定根本原因。他们对比多种方法权衡,发现Muon + 奇异值裁剪推动权衡边界,且工作完全开源。

AGI Hunt
推荐文章7

万字长文!大模型LLM推理优技术总结

文章围绕大模型LLM推理优技术展开,先介绍LLM推理各阶段、批处理、KV缓存等概念及内存需求,再阐述模型并行、注意力机制优模型模型服务等技术,如Pipeline并行、MQA、量、动态批处理等。

OpenMMLab
算法论文8

拒绝“熵崩塌”和“熵爆炸”!这项研究让大模型学会“精确探索”,推理成绩飙升

2024年以来,大模型在推理任务上进展显著,得益于RLVR方法,但面临“熵困境”。研究团队提出选择性熵正则方法(SIREN),通过三重机制精准调控探索行为,实验证明其能提升模型推理成绩。

量子位
算法论文7

AI集体“听不懂”!MMAR基准测试揭示音频大模型巨大短板

MMAR基准测试对30款音频相关模型进行测试,结果显示,多数开源模型面对复杂音频推理任务远未达实用水平,音乐任务中所有模型表现不佳,且有显式推理能力的模型表现更优。

量子位
开源动态8

以小博大!Nanbeige4-3B重磅开源:硬刚Qwen3,挑战小模型能力新高度

近年来大语言模型参数膨胀,成本升高,业界重注小语言模型。近日,Boss直聘南北阁大模型实验室发布仅30亿参数的Nanbeige4 - 3B,在多方面媲美甚至超越通义千问Qwen3系列模型,开源印证小模型潜力。

AIGC开放社区
算法论文7

多模态模型挑战北京杭州地铁图!o3成绩显著,但跟人类有差距

近年来,多模态大模型在多种场景取得进展,但能否‘看懂图’存疑。西湖大学等团队提出评测基准ReasonMap,评估模型在地铁图理解中的能力,发现主流模型有瓶颈,闭源模型虽优但仍逊于人类。

量子位