「长上下文大语言模型」共找到 8146 篇相关文章
字节&MAP重塑大模型推理算法优化重点,强化学习重在高效探索助力LLM提升上限
强化学习虽提升大语言模型表现,但面临探索难题。字节跳动等团队提出FR3E框架,分两阶段重建探索机制,在多数学推理基准实验中显著优于强基线,为大模型强化学习提供新范式。
字节 AI 卷出新高度:豆包试水“上下文定价”,Trae 覆盖内部80%工程师,战略瞄定三主线
近日字节分享 AI 技术发展三主线,6 月 11 日火山引擎有系列发布更新。豆包 1.6 实行上下文定价,成本降低;超 80% 字节工程师用 Trae;视频生成模型 Seedance 1.0 Pro 具性价比;智能体带动强化学习算力攀升。
AI 的本质不是算力,而是「上下文革命」
上交大刘鹏飞团队提出人工智能本质是“上下文革命”,在论文中把“上下文”提升为智能系统核心结构,提出“上下文工程”学科框架,通过实验揭示智能发展规律,为AI发展指明新方向。
80%美国AI初创靠中国开源模型“吃饭”!a16z投资人震惊,全球开源榜前16名全被中国包揽
Reddit上“中国开源AI模型席卷美国初创”帖子爆火。a16z合伙人Martin Casado称80%美国AI初创融资路演用中国开源模型。Design Arena榜单前16名开源模型全是中国的,中国开源模型优势尽显。
刚刚,小红书开源了首个多模态大模型dots.vlm1,性能直追SOTA!
小红书人文智能实验室(hi lab)低调开源视觉语言模型dots.vlm1。该模型基于自研视觉编码器构建,在视觉理解和推理任务上接近SOTA水平,实测表现惊艳,还介绍了其技术架构、预训练数据布局等内容。
半年研发、1周上线,1秒200行代码爆发?美团研发负责人:靠小团队奇袭,模型和工程能力突破是核心
美团基础研发平台工程效率负责人程大同在访谈中解答了美团 AI Coding Agent 产品 NoCode 的相关问题,包括模型性能优化、产品定位、用户画像、使用边界等,还谈及与 CatPaw 的关系及未来规划。
斯坦福提出新的RL范式,让3B模型的Agent超越Claude、GPT-4
斯坦福提出新的RL范式,让小模型Qwen2.5 - 3B经训练后性能超越Claude - 3.5 - Sonnet等大模型。论文解决了RL在代理环境中可变时长动作优化偏差和稀疏奖励两大挑战,为AI代理发展指明方向。
研究者尝试揭示扩散模型创造力的起源
斯坦福大学研究人员 Mason Kamb 与 Surya Ganguli 在论文中提出解释扩散模型创造力的机制,指出其创造力是去噪生成图像时的确定性结果,还识别出关键偏置,搭建 ELS 机模型并验证其准确性。
给大模型「持续注入新知识」,北航CASE框架:编辑千次不失忆,额外参数不到1MB丨WWW'26
北航团队提出CASE框架解决大语言模型持续吸收新知识难题。该框架给编辑“算分”、调“关键神经元”,破解核心痛点。实验显示,1000次编辑后准确率提升近10%,额外参数不到1MB。
让AI打游戏!能玩1000多款游戏,英伟达用4万小时视频训练出通用基础模型NitroGen
NVIDIA发布NitroGen模型,利用40000小时带按键显示的游戏视频,构建视觉-动作数据集,训练出能玩超1000款游戏的通用基础模型,在跨游戏泛化和微调任务中表现卓越,为具身智能发展提供新思路。