代码专用模型」共找到 8707 篇相关文章

算法论文8

1.5B推理模型新SOTA,RL训练新解法打破「简单题过拟合、难题学不动」的魔咒

QuestA通过在训练中注入解题提示,实现两项成果:在1.5B模型上实现Pass@1的SOTA性能,还提升了Pass@k性能。它解决了RL训练中简单与困难任务的权衡问题,为开发强推理模型打开大门。

机器之心
推荐文章7

这个一年前出现的词让小白从 0 到月入 1 万美金成为现实

一年前,Andrej Karpathy 提出“Vibe Coding”,用户通过 AI 用自然语言提示生成代码,开发更快、构建更易,让小白也能写代码。如今它成现象级术语,未来还会持续发展。

MacTalk
开源动态7

推理成本骤降75%!gpt-oss用新数据类型实现4倍推理速度,80GB显卡能跑1200亿参数大模型

OpenAI在gpt - oss开源模型采用MXFP4数据类型,使推理成本降75%,内存占用为BF16模型四分之一,生成token速度提4倍,还能降低硬件资源需求。不过MXFP4也有缺陷,英伟达推出NVFP4提升质量。

量子位
算法论文8

0.01%参数定生死!苹果揭秘LLM「超级权重」,删掉就会胡说八道

苹果研究人员发现大模型中极少量的「超级权重」,即便占比仅0.01%,对模型能力影响巨大。这一发现为大模型「科学瘦身」提供思路,还提出定位方法,助力模型量化和未来研究。

新智元
产品应用8

对话原力灵机周而进:模型2.4B就够用,关键是“具身原生”;能闭环才是最高效方法

原力灵机推出首个具身原生模型产品DM0,仅2.4B参数,却能支撑实时处理画面与真机进化。其合伙人周而进称要走具身原生路线,还介绍了数据采集、模型训练等多方面内容及公司发展规划。

量子位
开源动态8

Paper2Page: 让每一篇论文都能“自己长出”一个项目主页

AI领域论文众多,研究者难让工作脱颖而出,精美项目主页很重要但制作繁琐。AutoPage是多智能体协作框架,能将论文一键转为项目主页,经三步协作,在速度、成本、质量等方面表现出色,代码已开源。

深度学习自然语言处理
8

模型狂叠 buff、Agent乱战,2025大洗牌预警:96%中国机器人公司恐活不过明年,哪个行业真正被AI改造了?

InfoQ编辑部发布《2025年度盘点与趋势洞察》,探讨大模型、Agent等领域变化,分析行业被AI改造情况。指出2025年格局重塑,竞争焦点转变,国内AI有进展但与硅谷有差距,还介绍了大模型、Agent、AI Native等发展趋势。

InfoQ
开源动态8

NanoCoder:我把50万行的claude code核心机制浓缩成1000行,不可能学不会了吧!

Claude Code 源码泄露后,kimi Agent 团队何宇峰大佬的 NanoCoder 项目,用 950 行 Python 代码重写其核心机制。它实现 7 种关键设计模式,可助理解顶级 AI 编程 Agent 核心设计,还能按需修改。

探索AGI
新闻资讯7

爆冷!字节Seed 在CCPC 决赛只做出一道签到题,而DeepSeek R1 直接挂零?

第十届 CCPC 举行,字节 Seed 携 Seed - Thinking 参赛,结果意外,仅做出一题,DeepSeek R1 挂零。不同模型架构表现差异不大,暴露出大模型做算法题短板,推理模式表现更好。

InfoQ
开源动态8

全球首次实测通过!CMU华人用AI设计的乐高「不翻车」

CMU研究人员提出LegoGPT,它微调Meta的LLaMA模型,结合47000个稳定结构数据集,确保98.8%的乐高设计符合物理定律,可实际搭建。目前,数据集、代码模型均已开源。

新智元