大记忆模型」共找到 9386 篇相关文章

开源动态7

Rex-Omni:用 3B 模型颠覆目标检测

长期目标检测依赖传统坐标回归模型,MLLMs方法存在不足。IDEA研究院提出30亿参数的Rex - Omni多模态模型,在零样本测试中表现超现有回归模型,还具备丰富语言理解能力,有独特设计和训练流程。

带你学AI
产品应用8

横扫海外的阿里模型,有自己的APP了,叫“千问”

11月17日,阿里巴巴上线“千问App”,将Qwen系列模型装进面向C端用户的独立App。它设计极简,功能强,免费使用。主模型为Qwen3,问答结构化,多模态交互方便,还有翻译等特色功能,背后是强的Qwen模型生态。

MacTalk
开源动态8

腾讯混元CL-bench续作发布,让模型读懂你的日常生活

腾讯混元团队推出CL - Bench Life,用于精准衡量AI在现实生活中的“上下文学习”能力。测试12个语言模型,结果显示模型处理高噪声零碎context能力不足,揭示当前顶尖AI模型还远未读懂日常。

机器之心
产品应用8

AI Code要变天了,Meta首个代码世界模型登场!

Meta FAIR推出32B参数的代码世界模型(CWM),旨在探索世界模型如何改变代码生成和推理,code和mode已开源。在SWE - bench验证中表现优,能与更规模或闭权重的LLM竞争,还介绍了训练、数据集等情况。

PaperAgent
算法论文8

POF | 上海理工学梁梓浩、朱兵等:使用语言模型进行气泡湍流实验数据处理

本文提出结合语言模型(Time - LLM)与Transformer模型的复合框架处理气泡两相流热膜测量信号干扰。先由Time - LLM识别气泡干扰信号,再用Transformer模型修复。实验证明该方法高效、轻量且物理自洽。

力学与人工智能
推荐文章7

「Memory as a Context」是否将重新定义 Transformer 的 「记忆模式」?

本期机器之心PRO会员通讯解读3个AI业内要事,包括「Memory as a Context」能否重新定义Transformer记忆模式、世界模型发展情况,以及OpenRouter联合a16z发布的《State of AI》报告。详细探讨了谷歌Titans架构及其理论框架MIRAS,还提及业界对LLM记忆力的改进方案。

机器之心
开源动态7

字节开源了一个了不得的模型

字节跳动开源统一多模态基础模型BAGEL,一个模型能同时理解和生成文本、图像、视频。部署测试有亮点但效果不稳定,还分享该模型体验Demo、地址及安装使用教程。

探索AGI
算法论文8

CoT推理溃败?哈佛华人揭秘:LLM一思考,立刻就「失智」

新研究揭示思维链CoT会分散模型「注意力」,使模型推理时易出错。研究指出在需遵守指令任务中,用CoT推理模型准确率下降,还总结了四模式,并提出四种缓解策略。

新智元
开源动态7

突发!Qwen更新模型,全面超越kimi k2,强的离谱,主打Agent

Qwen小更新非推理模型性能强劲,各项指标超kimi k2,与Claude opus 4持平,Agent能力亮眼。Qwen团队告别混合思维模式,新模型上线,独立训练两模型,新版本多方面提升,团队称还有招。

AI寒武纪
产品应用7

Unsloth让模型跑在手机上!

Unsloth放出教程,可将其微调模型部署到Pixel 8和iPhone 15 Pro。用ExecuTorch技术优化,Qwen2 - 0.5B在旗舰机上表现流畅。教程介绍量化感知训练控制精度损失,还给出iOS和Android部署步骤及注意事项。

AI工程化