「自回归基座模型」共找到 7810 篇相关文章
一键式训练端到端Agent,Qwen3+MCP工具集高效集成!
RLFactory是开源的端到端RL后训练框架,将环境与训练解耦,用Qwen3基座调用MCP工具集,可低代码训练端到端Agent模型。它极致易用、训练高效,还支持一键式训练,未来会更易用高效。
1万亿参数Ling-1T开源,国产LLM牛了~
Ling-1T是Ling 2.0系列首款旗舰“非思维”模型,总参数量达1万亿。预训练数据超20万亿token,支持128K上下文长度。在多项任务中表现出色,是目前已知最大的FP8训练基座模型,已完成全面评测。
告别「边画边说」:LatentMorph 开启视觉生成隐式潜空间推理新范式
现有的文生图模型缺乏动态思考与自我修正能力,香港科技大学团队提出LatentMorph框架,将隐式潜空间推理集成到T2I生成过程中,实验显示其显著提升基座模型性能,削减推理延时与Token消耗,实现人机认知对齐。
机器人连续叠衣120分钟!仅用0.9B参数实现五大SOTA|清华AIR & 上海AI Lab开源
清华大学智能产业研究院与上海人工智能实验室联合发布通用跨本体具身基座模型X-VLA。它是首个实现120min无辅助自主叠衣的全开源模型,仅0.9B参数量就在五大权威仿真基准刷新纪录。
奥特曼承认OpenAI路线走偏了,以及“写代码将变得不再重要”
奥特曼在直播中给出诸多实诚结论,如未来工程师人数或大幅增加,写代码时间将减少,OpenAI搞砸ChatGPT5系列模型,后续会回归通用模型,还探讨了AI对教育、经济、安全等方面的影响。
蚂蚁灵波开源LingBot-VLA后训练代码!150条示教数据即可适配新机器人
蚂蚁集团旗下灵波科技全面开源具身基座模型LingBot-VLA的真机后训练工具链,覆盖四个关键环节。模型基于2万小时真实机器人数据预训练,仅需150条演示数据就能迁移任务,训练效率更高。代码库已在GitHub开源。
AI圈“集体开大”!DeepSeek、Claude带头,智谱、阿里、蚂蚁、智源都“卷”起来了
双节前最后一天,AI圈“卷”疯了!智谱发布并开源GLM - 4.6,是国内最强Coding模型;阿里介绍视、听、说全模态同传大模型Qwen3 - LiveTranslate - Flash;蚂蚁开源万亿参数推理大模型Ring - 1T - preview;智源开源跨本体基座大模型RoboBrain - X0。
模型大一统?1100多个模型殊途同归,指向一个「通用子空间」!
约翰斯・霍普金斯大学研究发现,1100多个不同神经网络,即便训练条件不同,最终权重会收敛到共享低维子空间。此研究为神经网络参数空间“通用性”提供严谨实证,虽成因待探索,但意义深远。
谷歌神秘模型Kingfall泄漏!
近日,谷歌AI模型Kingfall在AI Studio平台短暂开放后意外曝光。它具备多模态处理能力,上下文窗口6.5万个token,有两种模式。生成SVG矢量图能力超Claude 4,身份猜测不断。
大语言模型逻辑评估
现有归因问答评估方法有‘归因短视’问题,研究团队提出 LOGICSCORE 框架,从三维度量化推理质量。在多数据集测试多款 LLM,发现专有、开源模型等存在不同逻辑问题,还分析典型逻辑错误。