大模型后训练」共找到 9554 篇相关文章

算法论文8

Evaluation is All You Need:评估设计的微小差异如何扭曲结果

论文以DeepSeek - R1 - Distill系列模型为例,指出模型评估中看似客观的基准测试结果对评估细节极度敏感,细微评估条件变化会致分数波动,削弱模型对比可信度,呼吁建立新评估标准。

深度学习自然语言处理
新闻资讯7

AI手搓蒙娜丽莎!8次临摹,最像那版全被自己改没了

AI工具平台TryAI搭建「绘画竞技场」,让GPT - 5.6 Sol等四个视觉模型临摹蒙娜丽莎等,记录实验过程。结果显示,模型最终作品不如中途最佳版,且成本差异,工具使用方式不同。

新智元
推荐文章7

Agent 开发,迎来「AI 云原生」时刻

模型时代,交互主体变为 Agent,「AI 云原生」应运而生。它围绕 Agent 重构架构,有全新技术栈。基于火山引擎工具和模型,展示了 Agent 开发的新流程,还做了两个应用案例。

特工宇宙
新闻资讯8

0.027B手机AI模型,估值2亿美金,三个清华学霸如何获得国际学生创新赛冠军

10月15日,清华万格智能团队“基于类脑架构的下一代通用模型与智能体生态”获中国国际学生创新赛(2025)冠军。团队由三个清华本科生创立,此前已完成融资,估值达2亿美元。其智人HRM模型有诸多优势,还研发出顶尖气候预测专家模型

AIGC开放社区
产品应用7

Cursor为Blackwell从零构建MXFP8内核,MoE层提速3.5倍,端到端训练提速1.5倍

Cursor团队从NVIDIA的Hopper H100s升级到Blackwell B200s后遇性能瓶颈,他们回归基础,从零重写MoE训练层,抛弃对现有CUDA库依赖,释放了Blackwell架构潜能,实现MoE层和端到端训练提速。

机器之心
开源动态8

他们让万亿参数RL学会了「省着跑」,顺便砍掉九成算力

2025年,强化学习成模型进化主战场,但万亿参数模型跑RL成本高。Mind Lab团队实现1T参数模型LoRA高效RL训练,GPU消耗降90%,技术开源。此外还有Memory Diffusion记忆机制等成果。

量子位
算法论文8

迈向原生全模态AI智能体:人&小红书发布OmniGAIA新基准

中国人民学等团队推出 OmniGAIA 新基准及 OmniAtlas 训练框架。OmniGAIA 含 360 个高难度任务,覆盖多领域。实验显示闭源与开源模型差距,OmniAtlas 显著提升开源模型表现,并指出未来全模态智能体发展方向。

PaperAgent
算法论文8

多模态幻觉的病因「高熵节点」找到了!全基准幻觉率下降

多模态推理模型的幻觉常出现在生成转折词时,此时模型处于高熵关键节点,易脱离图像证据。研究者提出LEAD,高熵时保留候选推理方向,注入视觉锚点拉回证据,实验显示它能跨领域提升模型性能。

新智元
新闻资讯7

AI圈水太深:OpenAI保密、Meta作弊!国产MoE却异军突起

文章梳理语言模型发展,从传统稠密架构到稀疏MoE架构,参数从百亿到万亿。介绍OpenAI、Meta等厂商模型,如GPT系列、Llama系列,还提及Mixtral、DeepSeek V3等。指出Meta作弊丑闻,国产MoE模型异军突起。

新智元
产品应用7

Cursor Composer 2.5 拆解:最强的 RL 环境,就是你自己的产品

今年5月,Cursor推出Agentic编程模型Composer 2.5,相比前代能力更强、成本效率更高。Cursor研究负责人认为最强的RL环境就是自己的产品,文中还介绍了Composer 2.5训练方式、面临的挑战及解决办法等。

Founder Park