「生成式模型」共找到 9051 篇相关文章

算法论文8

破解AI对不同上下⽂位置的敏感度不⼀致,新框架使出“解铃还须系铃人”

语言模型存在位置偏见,影响复杂推理等任务。论文提出Pos2Distill框架,将模型优势位置能力迁移到劣势位置缓解偏差,设计了Pos2Distill - R1和Pos2Distill - R2,在检索和推理任务表现好且有跨任务泛化能力。

量子位
算法论文7

MOE RL实战:统一FP8全流程训练

SGLang RL团队等联合完成工作,实现RL中全流程FP8训练与采样。介绍FP8训练硬件基础、格式、scale选择等,指出训练难点,分析KL Loss异常归因,验证其在MoE模型RL应用效果,还探究模型规模对训推不一致性的影响。

GiantPandaLLM
算法论文8

27M参数战胜GPT-4!脑启发的分层Reasoning引擎如何重塑LLM

当前大语言模型(LLM)核心架构存在根本性缺陷,受大脑分层处理和多时间尺度启发,本文提出仅2700万参数的分层推理模型(HRM),免预训练与CoT标注,单次前向传播解决复杂任务,在ARC - AGI上超越GPT - 4等LLM。

深度学习自然语言处理
新闻资讯7

手握30亿、被蚂蚁狂挖人,转型被骂惨的王小川,真的翻身了?

在大模型竞争中,2023 年成立的百川战略收缩聚焦医疗,起初内外存疑。2025 年,AI 医疗技术与应用进展显著,今年初大厂入局。百川如今开源 Baichuan - M3 模型,王小川认为医疗已入应用阶段、多模态非主战场,且国内 To C 更好。

InfoQ
新闻资讯8

LeCun炮轰Hinton:他认可LLM就是想摆烂退休了!

Yann LeCun在播客专访中火力全开,炮轰Hinton认可LLM是想摆烂退休,直言LLM不是通往智能的路,还吐槽Meta卷入LLM竞赛后无法专注研究。他介绍了新公司AMI和世界模型、JEPA等技术,认为JEPA类世界模型五年内将统治AI圈。

量子位
新闻资讯8

Karpathy、Claude Code之父Boris,最新访谈,把整个程序员圈炸了!

假期红衫AI Ascent 2026上,Claude Code之父Boris与Karpathy演讲引发关注。Boris称编程执行层已解决,他用Claude App工作,全公司代码由模型生成;Karpathy提出Software 3.0概念,还谈到模型能力不均匀。两人还对面试、创业等给出看法。

探索AGI
推荐文章8

AI 的终极护城河不是模型

硅谷风投投资人Jaya Gupta指出,当AI领域趋同,产品易被复制时,公司组织形态才是难以复制的护城河。如OpenAI、Palantir围绕新型工作创造新型机构,吸引特定人才。公司应匹配叙事与组织形态,选人要注重结构认可。

五源资本 5Y Capital
开源动态8

一行 Python,生成绝美城市地图海报!

开源君发现宝藏项目`prettymaps`,这是巴西开发者Marcelo Prates的开源作品,能从OpenStreetMap拉取数据画定制地图。它功能丰富,安装简单,可让普通人轻松进行地图视觉创作。

开源先锋
推荐文章8

模型不是企业的护城河,那什么才是?

文章指出企业AI进入深水区后,真正的竞争是将AI变成企业自己的智能引擎。衔远科技创始人周伯文提出泛化基础上的深度专业化是企业竞争力来源。衔远发布EnterpriseClawBench,揭示企业需私有化评估和可持续进化能力。

量子位
新闻资讯7

谷歌Gemini-0605发布,全球大模型第一!

昨晚谷歌发布Gemini 0605版本,官方称其回归0325版本效果。该版本在多项基准测试中领先,Elo评分提升。谷歌针对反馈改进,使Gemini 2.5 Pro回答更优,还取消日期后缀,输入输出Token价格有优势。

探索AGI