「大模型架构」共找到 9822 篇相关文章
Scaling Law 仍然成立,企业搜广推怎么做才能少踩“坑”?
InfoQ《极客有约》X AICon 直播栏目邀请京东、荣耀等专家探讨生成式推荐落地洞察。指出搜广推领域 scaling law 仍成立,大模型改变特征工程等,还分享了系统架构、模型应用等方面经验及挑战。
4位图灵奖得主布道,2大冠军机器人登台,“AI春晚”果然又高又硬
智源大会堪称“AI春晚”,规格高看点多。4位图灵奖得主分享观点,长跑冠军天工和拳击冠军宇树G1机器人秀技能。大会还发布“悟界”系列大模型,RoboOS 2.0与RoboBrain 2.0开源,多方探讨下一代AI发展路径。
开启端侧长文本时代!面壁全新架构,让小钢炮最快提升220倍
2025智源大会上,面壁智能发布MiniCPM 4.0模型,实现行业首个系统级上下文稀疏语言模型创新。它在端侧推理任务上表现出色,降低缓存需求,提高运行效能,还进行多维度架构创新,是AI领域探索高效率语言模型的里程碑。
Altman 秀新模型“翻车”,谷歌补刀躺赢!OpenAI 前员工爆肝 3 天,编程再赢老东家模型!
近期,OpenAI 携多款未公开新模型亮相。在 IMO 竞赛中,其宣称新模型获金牌,谷歌 DeepMind 的 Gemini Deep Think 也达金牌水平,但网友对二者评价不一。此外,‘o3 Alpha’疑上线,前 OpenAI 员工还在编程赛中击败 OpenAI 模型。
Qwen3技术报告首次全公开!“混合推理模型”是这样炼成的
本文首次公开Qwen3技术报告,介绍其模型架构、预训练及后训练过程、性能表现等技术细节。Qwen3整合两种模式,引入思考预算机制,降低轻量级模型计算资源,在多基准测试领先,多语言支持扩展至119种,所有模型开源。
GPT-5认为这个模型是开源界的Claude 3.5——陈天桥朋友圈里的 MiroMind ODR 让我眼前一亮
陈天桥用GPT - 5评测自家开源模型MiroMind ODR,让其应对复杂问题。GPT - 5评价该模型是“开源界的Claude 3.5”,其能力让GPT - 5“点赞”,有闭源模型稳定性和可用性,还具全开放架构。
阿里巴巴大模型品牌统一为千问
今天,阿里巴巴AI总称和核心品牌统一为千问,涵盖基础与专业领域模型,千问APP是C端旗舰应用。今年除夕开源千问3.5,多款中小型模型上榜,春节用户下单近2亿次,DAU大增成国民级助手。
分享2个模型省钱大法
文章分享两个大模型API省钱技巧。一是文本转截图,适用于输入长输出短、费用花在输入token的任务;二是音频加速识别,OpenAI语音识别模型Whisper按音频时长收费,加速音频可省钱,还可包装成API服务盈利。
Reasoning模型可以Self-Train!
当前大模型依赖人类标注数据,成本高且扩展难。论文探讨模型自我纠错、自主进化可能,提出自我奖励训练(SRT),用投票共识代替人类标注。在数学数据集上有效果,但高难度数据集出现问题,作者给出解决办法并开源代码。
AI已迷失方向?强化学习教父Sutton最新发布OaK架构,挑战当前AI范式,提出超级智能新构想
强化学习教父理查德·萨顿认为人工智能发展已迷失方向,提出OaK架构回应探寻真正智能的需求。该架构是基于模型的强化学习架构,具备组件持续学习等特点,为通用人工智能指明路径,但面临持续学习和特征生成挑战。