潜在视觉推理」共找到 2587 篇相关文章

算法论文8

RLPT:腾讯混元在预训练数据上实现自主强化学习

腾讯混元团队发布RLPT,是在预训练数据上应用强化学习的方法,可突破大语言模型扩展瓶颈。它能让模型自主学习推理能力,无需人工标注,在Qwen3 - 4B - Base模型实验中性能显著提升。

AI工程化
开源动态8

腾讯混元发布并开源图像模型 2.1,支持原生 2K 生图

9月9日深夜,腾讯发布并开源混元生图模型“混元图像2.1”,支持原生2K高清生图,综合能力领先。它在多方面升级,有诸多亮点,评估显示效果优,还同步开源文本改写模型,能满足多样视觉需求。

InfoQ
开源动态8

开放全栈!超越π0,具身智能基础大模型迎来真·开源,开发者狂喜

继π0后,具身智能基座模型WALL - OSS正式开源,多项指标超越π0。它是通用多模态具身模型,具良好推理和泛化能力。背后自变量机器人刚完成近10亿A + 轮融资,开源将降低具身智能门槛。

量子位
新闻资讯8

GPT之父把AI扔回1930年:没见过一行代码,却「发明」了Python!

GPT之父Alec Radford带队发布总参数130亿的大模型「talkie」,其训练数据冻结在1930年,没学过编程却能写Python代码,证明LLM可用旧知识推理。团队后续还有升级计划。

新智元
产品应用8

面壁MiniCPM-SALA模型,稀疏-线性注意力,单卡吞吐百万上下文

面壁智能团队提出SALA,基于此训练的MiniCPM-SALA模型,在单张A6000显卡实现百万token超长上下文推理,训练成本降约75%。它结合稀疏与线性注意力,采用混合架构,继承权重降低成本,在长文本处理上优势明显。

AIGC开放社区
开源动态8

DeepSeek深夜炸场,开源了一个新项目&论文,V4打前站?

凌晨,DeepSeek开源新项目Engram并公开论文。Engram用可扩展的O(1) N - gram记忆替Transformer早期层节省算力,在多方面实验表现出色,如推理任务增幅大于知识任务,还分析了其机理和系统效率。

PaperAgent
算法论文7

八年后,Meta教会了Transformer「显式思考」

10月20日Meta上线新论文《The Free Transformer》,作者François重写Transformer思维方式,造出Free Transformer新架构。它在解码器内加入随机潜在变量,让模型生成内容前先‘思考’,实验显示在多任务上性能显著提升。

机器之心
新闻资讯8

OpenAI惊人自曝:GPT-5真「降智」了!但重现「神之一手」,剑指代码王座

GPT-5发布后引发热议,其IQ测试成绩不佳遭吐槽,但实际是「路由」问题。解锁神级GPT-5关键在prompt,医学家借它重现「神之一手」。它编程能力强,挑战Anthropic,还推动AI向「智能体式推理」发展。

新智元
新闻资讯7

刚刚,Anthropic发布Sonnet 5,性能接近Opus 4.8,但不一定更便宜

Anthropic发布Claude Sonnet 5,称其为最具Agent属性的Sonnet模型。它在推理等方面性能提升,接近Opus 4.8且价格低。安全评估有改善,但网络安全逊于Opus 4.8。已正式可用,有优惠首发价。

机器之心
产品应用8

ChatGPT Images 2.0震撼发布!碾压谷歌Nano Banana,设计真要完了

北京时间凌晨3点,OpenAI发布ChatGPT Images 2.0,是先进模型,能处理复杂视觉任务。它精度控制力高、多语言能力强,风格表达成熟,支持多种宽高比,有现实世界理解能力等,已向相关用户开放,但也有局限性。

机器之心