「代码大模型」共找到 9950 篇相关文章
字节最新大模型秘籍:只挑能有推理潜力的数据训练!1.3B模型无需标签自动挑选
字节Seed团队发布AttentionInfluence成果,用1.3B模型给7B模型选数据,无需训练和标签。通过比较基础与弱化模型损失差异评估数据影响,在多基准测试提升模型性能,还能结合分类器全面提升表现。
神秘模型「Pony Alpha」引外网热议,它会是国产大模型中的谁?
近日,全球模型服务平台OpenRouter上搜索第一的神秘模型「Pony Alpha」引外网热议,它是新一代通用大模型,在多方面表现突出且可免费使用。网友、AI猜测其身份众说纷纭,已有人用它做出惊艳案例。
小米小爱同学:资源受限下,实现端侧大模型的高性能推理
InfoQ对话小米小爱同学端侧AI负责人杨永杰,探讨大模型端侧部署难题。团队自研推理框架,实现180 tokens/s推理速度,采用共享基座架构支持多业务。未来端侧大模型突破依赖硬件提升与架构演进。
“养团队造语言”时代终结?Rust传奇人物用Claude造出新开源编程语言,AI写下万行代码:大模型上限很高,我学会了高效用它!
Rust核心贡献者Steve Klabnik借助Claude写了新语言Rue并开源。他曾是AI怀疑论者,现认为大模型在编程中‘真的有用’。Rue目标是不依赖垃圾回收提供内存安全,使用体验更顺手,开发深度依赖Claude。
大模型转行土木工程!首个「打灰人」评估基准:检验读、改工程图纸能力
首个工程自动化任务评估基准DrafterBench,可测试大模型在土木工程图纸修改任务中的表现。它模拟真实工程命令,考察模型四方面能力。评测发现主流大模型有一定能力,但未达工程一线要求。
她如何把“系统2”带给了大模型 |对话微软亚洲研究院张丽
本文是量子位对微软亚洲研究院首席研究员张丽的访谈。张丽团队在2023年开始探索大模型深度推理能力,2025年1月发布rStar - Math,用蒙特卡洛搜索算法让7B模型实现o1级数学推理能力,引发广泛讨论。
小米小爱同学:资源受限下,实现端侧大模型的高性能推理
InfoQ对话小米小爱同学端侧AI负责人杨永杰,了解其团队在资源受限的端侧设备实现大模型高性能推理的策略。目前端侧大模型商业化落地慢,团队提前布局,自研框架,实现超180 tokens/s推理速度,还分享未来突破方向。
蚂蚁dInfer框架,让扩散大语言模型推理速度再飙10倍,相同模型性能下超越自回归模型
蚂蚁开源dInfer框架,联合名校发论文阐述实现细节。它解决扩散模型推理难题,提出创新算法和系统优化策略,实验显示其推理速度远超Fast - dLLM和自回归模型标杆vLLM,代码已开源。
清华唐杰新作:大模型能打掼蛋吗?
清华、北邮等团队联合研究表明大模型能打掼蛋等8种棋牌。不同模型在不同棋牌表现有差异,如GPT - 4o综合佳,GLM4是“全能型选手”。研究还探讨学习方法、模型性能影响因素及游戏间相互作用等。
探针伸进大模型黑箱,南加州大学华人团队打造AI记忆研究的深空望远镜
南加州大学 Robin Jia 教授团队借助英伟达算力,构建基于 Llama 3 架构的全开源受控大模型 Hubble,其成果将在 ICLR 2026 亮相。研究揭示大模型记忆机制效应,还评估了‘机器遗忘’技术,有法律应用潜力。