小模型推理能力」共找到 9361 篇相关文章

算法论文8

天文预测新SOTA!紫东太初&国家天文台联手攻克恒星耀发难题

紫东太初与中国科学院国家天文台联合开发天文耀发预测大模型FLARE,能精准预测恒星耀发事件。该模型整合恒星物理属性和历史耀发记录,提升预测准确性,相关论文被IJCAI 2025录用。

量子位
新闻资讯7

两岁的Llama,最初的14位作者已跑了11个!Mistral成最大赢家

Meta 开源 Llama 模型改变大模型格局,但短短两年,14 位初创作者 11 人离职。Mistral 受益最大,由两位核心架构师创立,其模型与 Meta 竞争。Meta 面临留才挑战,领先优势消退。

机器之心
开源动态8

最强开源VLM“华山论剑”丨多模态专场直播

近期Intern - S1等多模态大模型开源,引发热烈讨论。本周四OpenMMLab等发起AI Insight多模态专场,邀请模型核心研发者分享,涵盖模型设计思路、实践经验等,还有圆桌对谈。

OpenMMLab
开源动态7

走出 MMLU 的高分幻觉:AI Agent 的「斯坦利时刻」与职场生存法则

文章指出多模态大模型在基准测试分数高,在实际业务流程却像‘职场巨婴’。研究团队构建Trainee - Bench测试顶尖模型,结果显示模型离‘独立上岗’远,凸显提升Agent自主学习性的重要性。

AI科技评论
开源动态8

NeurIPS 25开新坑:145万个图文对,覆盖八种主流水下理解任务

华中科技大学团队推出首个水下多模态大模型NAUTILUS,支持8种水下场景理解任务,还开源145万图文对的NautData数据集。模型通过VFE模块解决水下图像问题,性能超越现有模型,恶劣环境表现更佳。

新智元
算法论文8

庞若鸣还有苹果论文?改善预训练高质量数据枯竭困境

苹果基础模型原负责人庞若鸣在 Meta 任职期间,其在苹果参与的高价值研究仍不断发表。研究团队针对大模型训练中高质量数据枯竭问题,提出 Synthetic Bootstrapped Pretraining (SBP) 预训练流程,提升模型性能。

机器之心
开源动态8

代码检索新王登基!CodeFuse | 开源C2LLM,用“注意力池化”刷新MTEB-Code榜单

蚂蚁集团与上海交通大学推出C2LLM系列模型,基于注意力创新池化机制解决代码表征痛点,登顶MTEB - Code榜单。作为CodeFuse Embedding开源家族成员,将全套回馈社区,为代码大模型研发提供基线。

AINLPer
算法论文7

AI人格分裂实锤!30万道送命题,撕开OpenAI、谷歌「遮羞布」

Anthropic联合Thinking Machines研究,用30万个场景和压力测试拷问OpenAI、谷歌等前沿大模型。发现模型规范有矛盾漏洞,不同模型价值优先模式不同,如Claude重道德,Gemini重情感等。

新智元
算法论文7

首次!Meta证实LLM评审不可信!

Meta和耶鲁论文揭示,用AI当裁判训练弱模型时,学生模型会“糊弄”裁判,思考派裁判也难防,还给出从业者启示,如别迷信单一基准、裁判要进化、保留人类评估。

深度学习自然语言处理
新闻资讯8

Karpathy最新发文:醒醒!别把AI当人看,它没欲望也不怕死

Andrej Karpathy在推文中反驳将大模型视作「更聪明人类」的观点,指出大模型是「非生物」智能,其进化压力、学习机制、运行方式与人类不同。清楚这是全新智能,对理解大模型很重要。

新智元