「LLM 模型」共找到 8040 篇相关文章
Qwen负责人转发2025宝藏论文,年底重读「视觉领域GPT时刻」
2025年末,Qwen大模型技术负责人林俊旸转发谷歌DeepMind入选ICCV 2025的论文,指出视觉领域“GPT时刻”要来了。研究用实验数据证明,视频模型正跳出任务专属局限,实现一个模型完成多视觉任务,推理过程还能被CoF“演”出来。
扩散语言模型九倍推理加速!上海交大:KV Cache并非自回归模型的专属技巧
上海交通大学EPIC Lab团队提出免训练推理缓存机制dLLM - Cache,复用特征降低计算量。它即插即用,通用于主流dLLM架构,在多个基准测试中实现数倍推理加速,且不降低生成质量。
国产模型开源封神,谷歌Genie3紧急开源?蚂蚁AGI撕开世界模型闭源防线
蚂蚁灵波发布开源SOTA级世界模型LingBot - World,全面对标谷歌Genie 3,部分性能指标超越。它有高保真、长视频生成等优势,还能解决具身智能痛点,发布后引发海外关注,促使Genie将开源。
宇树:开源机器人世界大模型!
宇树开源世界模型 - 动作架构UnifoLM - WMA - 0,它属UnifoLM系列,适配多机器人本体。真机部署表现出色,预测与实际操作吻合。官方介绍训练策略,代码开源后GitHub获100 + Star。
Agent也能蒸馏了!性能超好
大模型运行成本高,普通用户用不起。传统小模型模仿大模型解题步骤易出错。论文提出Agent蒸馏,让小模型学会用检索和代码工具,还加首思前缀与自我纠错“外挂”,使小模型性能直逼大模型。
一文解读 LLM Posting-Train技术
文章解读了大语言模型后训练(Post-training)技术,介绍其核心价值,从微调、强化学习、测试时拓展三方面展开,分析现有技术瓶颈,指出前沿研究方向,还给出实践指南和工具链推荐。
黄仁勋2026大模型座上宾:杨植麟
在英伟达2026年GTC大会嘉宾中,杨植麟是唯一来自独立大模型创业公司的代表。过往黄仁勋邀人有“风口预言术”,此次选杨植麟,或因他搞出K2.5、死磕推理效率,能给英伟达讲新故事。
Agent = LLM + Memory + Planning + Tool Use
文章指出LLM设计无状态,产生幻觉,超长上下文窗口也无法解决记忆问题。介绍人类记忆的三个系统,阐述Agent记忆四层演化及每层问题,推荐开源项目Cognee将向量、图、关系型结合互补。
工具增强的多模态LLM综述
多模态大语言模型(如GPT - 4V)虽有强大图文理解能力,但受数据稀缺、复杂任务表现不佳和评估标准不统一限制。论文提出为MLLM集成外部工具,构建全景图,覆盖多维度,还指出挑战与对策。
揭秘大模型Steering:从底层机理到系统评估,全面破解大模型行为控制之谜
近期《Science》研究表明可解析AI内部表征实现通用引导与监控。浙大联合阿里两篇ACL 2026主会论文,揭示Steering工作原理与能力边界,还开源一站式框架EasyEdit2,全面展示了Steering价值。