大模型技术」共找到 10346 篇相关文章

新闻资讯8

763亿港元,模型公司最规模IPO!MiniMax登陆港交所,开盘前涨50%

MiniMax正式在港交所主板挂牌上市,股票代码“00100”。此次全球发售约3358万股,募资约55.4亿港元。市场认购热烈,早盘一度涨幅超50%,市值突破763亿港元。其技术多模态齐发,组织高效,为行业提供新样本。

量子位
算法论文8

Monet:赋予多模态模型如人类一般的抽象视觉思考能力

文章介绍了Monet模型,它实现了训练MLLM直接在连续隐空间思考的方法,内化视觉思考能力。还阐述了多模态模型隐式推理训练的难点,提出SFT+RL训练框架,构建数据集,经测试,Monet提升了视觉推理能力。

机器之心
算法论文8

人类记忆 vs 模型记忆,到底差在哪?

这篇发表于 2025 年 10 月《Trends in Cognitive Sciences》的文章,探讨用人类“情景记忆”研究成果改进记忆增强型语言模型。指出现有 AI 记忆系统存用数据低效,呼吁构建“类人情景记忆”AI,还剖析差异并给出评估方法和展望。

深度学习自然语言处理
开源动态8

阿里 Qwen 又双叒发模型,继基础、编程模型后,最强推理模型 Qwen3 Thinking 登场,击败Gemini 、R1?

阿里通义千问发布最强推理模型 Qwen3-235B-A22B-Thinking-2507,逻辑、通用技能等能力更强,原生支持 256K 上下文。此前已发布基础和编程模型,Qwen API 在 OpenRouter 表现佳,受社区关注。

AI进修生
开源动态8

8B模型任务击败GPT-5?阶跃星辰开源Deep Think新框架,小模型解锁百万Token测试时计算

阶跃星辰推出并行协同推理框架PaCoRe,让模型突破上下文窗口和处理速度限制。基于此框架,小模型能解锁百万级Token测试时计算。PaCoRe - 8B在数学基准测试中超越GPT - 5,还具备前沿性能、“综合”能力涌现等优势。

机器之心
产品应用8

14K Star!统御万模的 AI 聚合网关,一个 API 管理所有模型

文章分享了AI聚合网关神器New API,它基于Go和React开发,是中转分发系统,像超级转换插头。集成30+模型服务,有多种特性,支持6种部署方式,能收敛混乱的模型调用。

开源星探
新闻资讯7

谷歌约战,DeepSeek、Kimi都要上,首届模型对抗赛明天开战

太平洋时间8月5 - 7日,8款前沿AI模型将在Kaggle Game Arena展开为期3天的国际象棋比赛,参赛方都是AI界顶流。谷歌称现有基准测试难跟上模型发展,这场比赛是探索新评估方法。赛制为单败淘汰制。

机器之心
算法论文8

华为诺亚发布ScaleNet:模型通用新范式

华为诺亚方舟实验室等团队提出 ScaleNet 方法,创新性地用少量额外参数量将模型深度扩展一倍。结合层级权重共享和轻量级适配器技术,在视觉和语言任务上验证了有效性,提升了模型性能。

机器之心
开源动态8

提出首个复数模型,2比特量化,推理仅加法,可手机部署!

团队提出iFairy方案,将模型权重量化到复数集合,用2比特表示,压缩至原本1/8。推理仅需加减或交换数据位置,成本更低。Transformer架构“复数化”,iFairy模型PPL降10%,性能反超全精度,相关成果已开源。

量子位
推荐文章8

Efficiency Law, 物理精确世界模型,及世界模型引擎驱动的具身智能学习新范式

2025年秋具身智能赛道火热,特斯拉、英伟达动作不断,数据问题成落地症结。跨维智能贾奎、港中(深圳)刘桂良探讨突破具身智能学习枷锁的方法,提出Efficiency Law和GS - World世界模型引擎及新学习范式。

机器之心