「大世界模型」共找到 9365 篇相关文章
POF | 上海理工大学梁梓浩、朱兵等:使用大语言模型进行气泡湍流实验数据处理
本文提出结合大语言模型(Time - LLM)与Transformer模型的复合框架处理气泡两相流热膜测量信号干扰。先由Time - LLM识别气泡干扰信号,再用Transformer模型修复。实验证明该方法高效、轻量且物理自洽。
字节开源了一个了不得的模型!
字节跳动开源统一多模态基础模型BAGEL,一个模型能同时理解和生成文本、图像、视频。部署测试有亮点但效果不稳定,还分享该模型体验Demo、地址及安装使用教程。
DeepSeek开源大模型记忆模块!梁文锋署名新论文,下一代稀疏模型提前剧透
DeepSeek最新论文给Transformer加上“条件记忆”,补上原生知识查找机制。梁文锋署名,与北大团队合作。提出全新范式及Engram模块,解决传统N - gram问题,研究稀疏性分配,验证推理能力提升,兼顾工程优化。
CoT推理大溃败?哈佛华人揭秘:LLM一思考,立刻就「失智」
新研究揭示思维链CoT会分散模型「注意力」,使大模型推理时易出错。研究指出在需遵守指令任务中,用CoT推理模型准确率下降,还总结了四大模式,并提出四种缓解策略。
突发!Qwen更新模型,全面超越kimi k2,强的离谱,主打Agent
Qwen小更新非推理模型性能强劲,各项指标超kimi k2,与Claude opus 4持平,Agent能力亮眼。Qwen团队告别混合思维模式,新模型上线,独立训练两模型,新版本多方面提升,团队称还有大招。
Unsloth让大模型跑在手机上!
Unsloth放出教程,可将其微调模型部署到Pixel 8和iPhone 15 Pro。用ExecuTorch技术优化,Qwen2 - 0.5B在旗舰机上表现流畅。教程介绍量化感知训练控制精度损失,还给出iOS和Android部署步骤及注意事项。
蚂蚁武威:下一代「推理」模型范式大猜想
文章围绕下一代「推理」模型范式展开,蚂蚁技术研究院武威提出不同观点,认为长思维链推理未必最优,未来推理模型或更低维稳定,还探讨推理定义、重要性及解法猜想,如结合快慢思考等。
神秘模型屠榜多日、碾压Seedance 2.0!背后竟是阿里大招:新部门首作实锤,引爆股价拉升
近日,神秘模型 HappyHorse-1.0 登顶 Artificial Analysis 视频模型排行榜。阿里巴巴确认其为 ATH-AI 创新事业部自研产品,正在内测,4 月 30 日上线 API。该模型技术亮点多,若开源或改变 AI 视频行业格局。
Meta超级智能实验室又发论文,模型混一混,性能直接SOTA
大语言模型训练依赖算力和时间,传统模型 Souping 多采用均匀平均。Meta 等研究者提出类专家 Soup(SoCE),利用基准测试类别构成选最优模型,非均匀加权平均,实验显示其提升了模型效果与稳健性,在排行榜获 SOTA 成绩。
苹果拆解AI大脑,推理模型全是「装」的?Bengio兄弟合著
苹果最新研究揭示大推理模型(LRM)在高复杂度任务中普遍‘推理崩溃’。即便给予明确算法提示,模型亦无法稳定执行,暴露推理机制的局限性。研究还通过多种实验环境分析了模型在不同复杂度问题中的表现。