大模型成本」共找到 9818 篇相关文章

新闻资讯7

硅谷佬带头弃用 OpenAI、“倒戈”Kimi K2!直呼“太便宜了”,白宫首位 AI 主管也劝不住

硅谷正从昂贵闭源模型转向便宜开源替代方案。“SPAC 之王”Chamath Palihapitiya 团队将量工作负载迁移至 Groq 平台的中国模型 Kimi K2,因其性能优且成本低。节目中还探讨中美开源模型现状等。

InfoQ
产品应用8

《生成式AI卓越架构设计指导原则》:从"能用AI"到"用好AI"

在2025云栖会上,阿里云发布《生成式AI卓越架构设计指导原则》,以云原生“卓越架构五支柱”为基础,针对模型内容合规与安全治理等领域提建议,助力企业从‘能用AI’走向‘用好AI’。

阿里云开发者
算法论文8

RLPT:腾讯混元在预训练数据上实现自主强化学习

腾讯混元团队发布RLPT,是在预训练数据上应用强化学习的方法,可突破语言模型扩展瓶颈。它能让模型自主学习推理能力,无需人工标注,在Qwen3 - 4B - Base模型实验中性能显著提升。

AI工程化
算法论文8

Think in Games:做一个在王者荣耀中会玩和思考的Agent

文章介绍论文《Think in Games: Learning to Reason in Games via Reinforcement Learning with Large Language Models》,指出当前AI在游戏领域面临的困境,提出TiG框架结合语言模型与强化学习,打造既会做又会说的AI,实验验证其高效性。

深度学习自然语言处理
推荐文章7

中学生就能看懂:从零开始理解LLM内部原理【十】| “过拟合” 与 Dropout

文章围绕神经网络过拟合问题展开,介绍了过拟合的概念、危害及产生原因,阐述了缓解过拟合的正则化方法,重点介绍了Dropout随机失活,还指出其局限性及在模型中的应用策略。

AI大模型应用实践
算法论文8

Dense、MoE之外第三条Scaling路径:交提出JTok模块,省1/3算力

上海交通学与小红书Hi Lab联合团队提出JTok/JTok - M模块,作为插件挂载在Transformer层,几乎不增算力和显存开销却显著提升性能。该模块构建新scaling路径,在多任务测试中全面提分,为模型发展提供新方向。

机器之心
算法论文8

JCP | 南科赵肃楠、王建春等:LESnets:基于物理信息神经算子的湍流涡模拟

本研究提出基于物理信息神经算子的LESnets方法,用于快速模拟粗网格上三维湍流时空演化。不使用标签数据,训练两种神经算子,验证了其有效性和泛化能力,效率显著优于传统方法。

力学与人工智能
算法论文7

拟合接近满分,外推却会跑偏:Meta 给缩放律加了一个指数

模型训练前,团队常用 Chinchilla 缩放律估算模型规模和数据量,但它在模型和数据极不平衡的边界预测易跑偏。Meta FAIR 提出的 Skaling 只增加一个耦合指数,降低外推误差,还采用 L 形采样降低试算成本

深度学习自然语言处理
推荐文章8

模型之上,才是真正的资产

微软CEO萨蒂亚·纳德拉在《没有生态的前沿,立不住》中提出,每家公司未来要构建人力资本与Token资本。强调Token资本构建靠学习闭环,还提出检验公司是否拥有Token资本的方法,呼吁避免价值集中到少数模型公司。

五源资本 5Y Capital
开源动态7

强迫模型自我争论,递归思考版CoT热度飙升!网友:这不就是多数推理模型的套路吗?

近日,概念CoRT火了,它在CoT基础上加了“递归思考”,能让AI递归思考响应、生成替代方案并选最优,结合“结构化自我批判”提升推理力。不过网友质疑它是“新瓶装旧酒”。

机器之心