长上下文模型」共找到 8183 篇相关文章

开源动态8

GLM-5.2 正式发布:开源之王来了,摸到了Opus-4.8

GLM-5.2正式发布,主打程任务能力,有1M token上下文窗口且完全开源。它在程任务基准评测中表现出色,与顶级闭源模型差距缩小,还解决了超上下文计算成本问题,同时应对了模型‘作弊’情况。

AI寒武纪
产品应用8

当万相2.5刚开卷有声视频,7月已经发布音频一体化的百度蒸汽机又开卷视频了

百度升级MuseSteamer蒸汽机视频生成模型,可生成任意度视频,生成中能更新prompt交互创作。其技术规划前瞻体系化,成本低,在多行业有应用和商业化空间。

AI进修生
开源动态7

Distilabel DeepSeek-R1 模型蒸馏教程

文章介绍结合distilabel与QLoRA技术定制专属大模型的路径。先用distilabel框架利用DeepSeek - R1生成医疗指令数据集,再用QLoRA技术微调Qwen3 - 4B模型,还给出实战路线图和代码示例。

机器学习AI算法工程
产品应用8

世界模型原生新一代范式!极佳视界斩获全球第一后,GigaBrain-0.5M*再进化

具身世界模型新一代原生范式登场,GigaBrain-0.5M*在多真实机器人任务中数小时零失误。它依托世界模型,创新引入人在回路机制,研发采用四阶段闭环训练流程,优势显著。

机器之心
开源动态8

阿里开源QwenLong-L1:首个以强化学习训练的上下文推理大模型

LRMs扩展到文本场景是挑战,阿里开源QwenLong-L1框架,是首个用强化学习训练用于文本推理的模型。它含三个核心组件,QwenLong-L1-32B性能领先,与Claude-3.7-Sonnet-Thinking相当。

PaperAgent
推荐文章8

极佳科技朱政:世界模型会进化成 VLA 的下一代|具身先锋十人谈

具身智能领域数据难题待解,极佳科技朱政投身世界模型研究。他认为世界模型短期内是‘驯化’VLA的容器,期或与VLA融合。其团队成果显著,还将探索多维度建模与数据配比优化。

AI科技评论
开源动态8

阿里AI 重磅第4发:电影级MOE 视频模型Wan2.2正式开源!

阿里通义团队开源电影级视频生成模型Wan2.2,将光影、色彩、镜头语言装进模型,支持60多参数自由组合。它是业界首个用MoE架构的视频生成模型,推理省计算资源,性能超主流模型,获国外网友盛赞。

AGI Hunt
算法论文8

ICML 2026 | 将多教师冲突转化为动态约束,破解多模态大模型推理对齐难题

在多模态大模型发展中,多教师知识蒸馏成提升性能关键,但教师模型存在“概念漂移”问题。悉尼科技大学团队提出 APO 框架,将模型间“漂移”转化为动态负约束,解决多模态大模型多师蒸馏概念对齐难题,工作被 ICML 2026 接收。

机器之心
推荐文章7

OpenAI分享了一份上下文工程实用指南。

OpenAI产品负责人Miquel联合Piotr发布Context Engineering深度指南。介绍了Context Engineering概念、6种核心上下文,指出RAG只是其中一环,还讲述信息检索的多种范式及上下文组装方法。

探索AGI
开源动态8

教多模态大模型学会“反思”和“复盘”,上交&上海AI Lab重磅发布MM-HELIX&AHPO,破解多模态复杂推理难题

上海交通大学和上海人工智能实验室研究团队带来MM - HELIX,这是完整生态体系,赋予AI链反思性推理能力。其含基准测试、数据集、优化算法,搭载相关技术的模型表现优异,部分成果已开源。

量子位