「大模型技术」共找到 10426 篇相关文章
RunAnywhere:简单几步让AI应用跑在手机上
介绍能在手机本地运行的大模型项目RunAnywhere,它让开发者在iPhone 16 Pro Max部署Llama 3.2 3B模型。AI处理本地化,用React Native和RunAnywhere SDK,支持多模型,有多种功能,优势明显。
他们让万亿参数RL学会了「省着跑」,顺便砍掉九成算力
2025年,强化学习成大模型进化主战场,但万亿参数模型跑RL成本高。Mind Lab团队实现1T参数模型LoRA高效RL训练,GPU消耗降90%,技术开源。此外还有Memory Diffusion记忆机制等成果。
GLM-4.5 验证:智谱已完成一轮“洗牌”
2025年大模型热度下降,智谱AI关注度降低。7月28日晚其发布新一代基础模型GLM - 4.5,体现战略调整成效。该模型专为AI Agent打造,性能出色,同时智谱人事、业务、收入等方面也有“洗牌”。
刚刚,Claude两个新模型曝光!
开发者在Anthropic的API中发现Claude的两个新模型代号claude - marshmallow - eap和claude - melon - eap,目前处于内部测试阶段。社区有多种推测,且Anthropic命名风格改变,新模型或下月发布。
200亿国产巨头,在这个赛道做到了全球第一
声学传感器龙头歌尔微电子冲刺港交所,它是全球第五大、中国第一大智能传感交互解决方案提供商,全球第一大声学传感器提供商,市场份额达43%。其发展历程长,技术投入大,虽面临挑战,但上市后未来可期。
Chiplet(芯粒) —— 后摩尔时代的芯片“乐高”玩法
当单芯片逼近物理极限,Chiplet技术应运而生,它将大芯片拆分成小芯片,通过先进封装技术整合。该技术成本低、良率高,应用场景多元,但面临热管理、测试和标准统一等挑战,未来发展前景广阔。
RLPT:腾讯混元在预训练数据上实现自主强化学习
腾讯混元团队发布RLPT,是在预训练数据上应用强化学习的方法,可突破大语言模型扩展瓶颈。它能让模型自主学习推理能力,无需人工标注,在Qwen3 - 4B - Base模型实验中性能显著提升。
Think in Games:做一个在王者荣耀中会玩和思考的Agent
文章介绍论文《Think in Games: Learning to Reason in Games via Reinforcement Learning with Large Language Models》,指出当前AI在游戏领域面临的困境,提出TiG框架结合大语言模型与强化学习,打造既会做又会说的AI,实验验证其高效性。
中学生就能看懂:从零开始理解LLM内部原理【十】| “过拟合” 与 Dropout
文章围绕神经网络过拟合问题展开,介绍了过拟合的概念、危害及产生原因,阐述了缓解过拟合的正则化方法,重点介绍了Dropout随机失活,还指出其局限性及在大模型中的应用策略。
Dense、MoE之外第三条Scaling路径:交大提出JTok模块,省1/3算力
上海交通大学与小红书Hi Lab联合团队提出JTok/JTok - M模块,作为插件挂载在Transformer层,几乎不增算力和显存开销却显著提升性能。该模块构建新scaling路径,在多任务测试中全面提分,为大模型发展提供新方向。