大模型推理训练」共找到 8463 篇相关文章

开源动态8

重塑AI记忆边界:MemOS开源!时序推理较OpenAI提升159%

近日,记忆张量等多家团队发布面向大模型的工业级记忆操作系统MemOS。它借鉴传统操作系统架构,实现AI记忆结构化管理,性能超OpenAI等方案,未来将成立社区、推进应用及持续迭代。

机器之心
算法论文8

多模态大模型持续学习系列研究,综述+Benchmark+方法+Codebase一网打尽!

近年来,生成式AI和多模态大模型进展显著,但在动态环境下实现持续学习是挑战。中科院自动化所联合香港院AI中心系统性研究,提出综述、方法、Benchmark和Codebase,为相关人员提供全面支持。

机器之心
开源动态7

这张信息图,居然是8B开源模型做的??

商汤新开源的 8B 多模态模型 SenseNova U1,架构独特,图像评测表现好,信息图生成能力强、延迟低。它具备图文交错能力,适合自媒体、敏感行业等,有在线体验和开源代码入口。

花叔
算法论文8

AEPO:智能体熵平衡策略优化,让探索更稳,推理更深!

中国人民大学与快手团队联合提出 AEPO 算法,解决熵驱动式智能体强化学习训练不稳等问题。它设计两项核心机制,在 14 个基准上优于主流算法,在 X 等平台获高关注。

机器之心
算法论文8

微调已死?Agentic上下文工程登场,无需微调实现模型进化

斯坦福大学等团队提出 Agentic Context Engineering 技术,让语言模型无需微调自我提升。它将上下文视为作战手册,引入三种协作角色与三项创新,实验显示其在两类任务上表现优异,成本和延迟显著下降。

机器之心
开源动态8

节前重磅:开源旗舰模型新SOTA,智谱GLM-4.6问世

国庆前智谱AI发布新一代旗舰模型GLM-4.6并将开源,它在多方面提升,如编码、上下文长度等,评测性能佳,token消耗降低。经实测,其代码、研究、开发等能力强,成全球开源AI领域重要力量。

机器之心
新闻资讯8

智谱创始人唐杰透露:原生多模态模型将在数月内上线

智谱创始人唐杰透露原生多模态模型数月内上线。智谱上市后股价涨幅大,但多模态是短板。唐杰还判断今年AI最可能在长时程任务突破,阐述技术支柱、自我进化等观点,称将重塑各行业。

AI前线
新闻资讯7

Karpathy:大模型交互的第三种范式来了?这是不是夸大其词

Anthropic 上线 Claude Tag,可让团队在 Slack 与 Claude 协作,能完成写 PR、数据分析等任务,有多人协作、积累上下文等特点。Karpathy 认为这是大模型 UI 第三次大改,但评论区有质疑,不过有大咖背书或成‘数字员工’。

AI工程化
产品应用7

GPT-5.4发布,最适合OpenClaw的天选模型登场了。

GPT-5.4发布,作者认为它是OpenClaw天选模型。此前Claude贵且受限,GPT-5.3-Codex世界知识差。GPT-5.4代码能力强、世界知识优,还具多特性,如大上下文窗口,目前ChatGPT已上线。

数字生命卡兹克
新闻资讯8

华为+DeepSeek,推理性能创新高!技术报告也公布出来了

华为昇腾在部署超大规模MoE时推理性能创新高,全面超越英伟达Hopper架构。其采用‘以数学补物理’方式,还将全面开源。团队从多方面优化,在不同硬件上取得优异性能,本周还将举办技术披露周。

量子位