大模型成本」共找到 9737 篇相关文章

算法论文8

VLA模型做长任务总断片?同济KC-VLA用关键帧链给治好了

VLA模型记性是短板,处理非马尔可夫任务常束手无策。同济学等提出KC - VLA框架,用关键帧链接赋予机器人全局时间感知能力,还构建了长时序记忆依赖基准测试,实验显示其性能优越。

PaperAgent
开源动态8

如何选择最佳多模态模型压缩方案?哈工、度小满开源EFFIVLM-BENCH基准测试框架

金融科技智能化转型中,LVLM部署受算力瓶颈制约。哈工与度小满联合开源EFFIVLM - BENCH基准测试框架,能为多模态模型压缩方案出具‘体检报告’,还揭示LVLM加速复杂性,推动技术发展。

机器之心
新闻资讯7

GPT-5.2考赢人类!OpenAI警告:模型能力已过剩,AGI天花板不是AI

GPT - 5.2在ARC - AGI - 2基准测试超人类,Poetiq系统让其准确率从60%提至75%。OpenAI称模型进入‘能力过剩’阶段,未来AGI进展不止靠模型,更需人机协同。

新智元
算法论文8

真·开外挂!MIT新研究:架构0改动,让模型解锁千万级上下文

MIT CSAIL团队提出递归语言模型RLM,不改动模型架构,让GPT - 5、Qwen - 3等模型具备千万级token超长文本处理能力。它将上下文处理“外包”,实验显示其处理规模超前沿模型,复杂任务优势显著,多数场景性价比高。

量子位
算法论文8

普林斯顿学等Nature揭秘:人类脑与语言模型共享同一套语言处理时钟

普林斯顿学等机构研究发现,语言模型层级计算序列精确映射人类脑处理语言的毫秒级时间动态,其与人类脑理解语言的先后顺序高度一致,为理解脑和开发神经网络架构开辟途径。

AIGC开放社区
算法论文8

首个时空时序推理框架:让模型真正读懂时空数据 | ACL'26

STReasoner是首个结合时间序列、空间结构和自然语言的推理模型,能识别异常源、追踪影响路径。研究团队构建数据生成框架和评测基准,采用三阶段训练策略,模型在多任务表现优,成本低且泛化能力强。

新智元
开源动态8

一个模型超了DeepSeek R1、V3,参数671B,成本不到350万美元

Deep Cogito 是旧金山 AI 初创公司,开源四款混合推理模型。最 671B MoE 模型性能超 DeepSeek v3 等,推理链比 DeepSeek R1 短 60%,训练成本不到 350 万美元。核心方法是迭代蒸馏与增强。

机器之心
新闻资讯8

首家央企AI独角兽浮出水面!背靠自研模型,4家国家队资本背书

中电信人工智能科技(北京)有限公司成为央企首家AI独角兽,完成首轮增资,引入四家国家级战略投资方。其靠自研“星辰”系列模型,在多领域突破,实现技术与市场认可闭环,有望推动AI产业落地。

量子位
算法论文8

上科何旭明团队新作:克服简单样本偏置,让多模态模型学会「难题优先」

上海科技学何旭明团队针对多模态模型幻觉问题,提出DA-DPO框架。该方法不依赖额外人工标注,通过动态调整样本权重,缓解简单样本偏置,在降低幻觉率同时提升综合能力,具成本效益。

AI科技评论
推荐文章8

深度解析模型技术演进脉络:RAG、Agent与多模态的实战经验与未来图景

模型作为产业变革核心引擎,RAG、Agent与多模态技术重塑AI与现实交互边界。本文解析技术演进脉络、实战经验与未来图景,介绍三者在各领域应用及面临挑战,为产业升级提供指引。

腾讯技术工程