大语言模型评估」共找到 8213 篇相关文章

开源动态8

DeepSeek多模态新范式:一张图压缩7056倍,思考能力反超GPT和Claude

DeepSeek上线多模态并开源新范式技术。该研究让AI用视觉原语思考,弥合语言与视觉指代鸿沟。它构建紧凑模型架构,信息压缩率达7056倍,训练分三阶段,测试中表现出色,也存在局限。

AIGC开放社区
算法论文8

SIGIR 2025 | 解决扩展和迁移难题,华为新加坡提出InstructRAG,提升高达19%

语言模型任务规划面临可扩展性和可迁移性挑战,华为新加坡团队提出 InstructRAG 方案,通过多智能体协同架构实现指令图扩展与少样本任务迁移,在多数据集测试中性能提升高达 19.2%。

机器之心
开源动态8

能让DeepSeek自进化的Harness!LlamaFactory作者开源新工具:0.2元自动造Agent

LlamaFactory作者郑耀威团队开源的PenguinHarness,是全球首个支持多Agent自进化的Harness,能自动构建、评测和改进Agent。它成本低、速度快,适配众多模型,还有严格契约保障安全。已在生产场景应用,效果显著。

机器之心
新闻资讯8

谷歌Nature震撼发文,Gemini教练暴打专家!医学双料冠军,秒出睡眠报告

谷歌DeepMind把Gemini版大模型PH - LLM调教成「AI健康私教」,将可穿戴设备数据转化为睡眠健身建议,准确率超人类医生。它经两阶段训练,在多项测试中表现优异,或开启预防医学未来。

新智元
算法论文8

告别微调!腾讯提出Training-Free GRPO:无需更新参数,还能保证泛化性,成为传统RL的有力替代

大型语言模型在专业领域表现不佳,传统微调方法成本高、易过拟合。腾讯优图实验室提出Training - Free GRPO,无需更新参数,通过上下文学习提升性能,成本低且泛化性好,是传统强化学习有力替代。

深度学习自然语言处理
开源动态7

AI还不会独自问诊,o3准确率仅为51.12%,上交大×SII开源高难度复杂疾病诊断测评集

上海交大与SII团队开源高难度复杂疾病诊断测评集DiagnosisArena。测试显示,现有大模型在复杂临床诊断任务中表现不佳,o3准确率仅51.12%,且选择题设置无法反映其真实能力。

量子位
开源动态8

通用的dLLM开发框架,让BERT掌握扩散式对话

扩散式语言模型(DLM)因缺乏易用框架和训练成本高受限。伯克利与UIUC团队基于dLLM框架,让BERT学会对话,证明‘离散扩散 + 轻量级指令微调’可赋予BERT强生成能力,还开源全流程代码。

机器之心
算法论文8

语音分离最全综述来了!清华等团队深度分析200+文章,系统解析「鸡尾酒会问题」研究

清华等多校及字节跳动研究者全面调研语音分离领域,撰写综述论文,分析200余篇代表性论文。从问题定义、学习范式、模型架构等多维度展开,还探讨评估指标、数据集等,指出未来挑战与探索方向。

机器之心
产品应用7

一手实测!不用研究小龙虾了:腾讯搬出QClaw,直连微信,零门槛

腾讯基于OpenClaw开源生态推出QClaw,主打简单、零门槛部署,可直连主流大语言模型,集成微信能远程操控电脑。还推出SkillHub技能社区,腾讯电脑管家有安全防护功能,但权限问题待解决。

机器之心
7

IMO怒斥OpenAI自封夺金,“91位评委均未参与评分”,网友:炒作无下限

OpenAI宣称新模型获IMO金牌不到24小时剧情反转,多位官方人士和大佬指其做法“粗鲁且不恰当”。其“金牌”成绩或站不住脚,未与官方合作,无评委参与评估。此事引发学术道德和商业炒作争论。

量子位