「代码实验」共找到 2813 篇相关文章
字节&MAP重塑大模型推理算法优化重点,强化学习重在高效探索助力LLM提升上限
强化学习虽提升大语言模型表现,但面临探索难题。字节跳动等团队提出FR3E框架,分两阶段重建探索机制,在多数学推理基准实验中显著优于强基线,为大模型强化学习提供新范式。
超越人类标注,Meta提出CoT-Self-Instruct:如何用"推理式自进化"重塑LLM训练
大语言模型发展需海量高质量训练数据,传统人工标注困境重重,现有合成数据方法也有缺陷。Meta提出CoT - Self - Instruct,通过推理式自进化生成数据,实验证明其在多个任务上超越人类标注数据。
全球首个从语言出发构建的智能体:MoonBit Pilot 如何推动自动化软件交付?
MoonBit Pilot是从语言底层构建的代码智能体系统,将AI Agent从“助手”推向“合作者”。它比Cursor、Codex更快更稳定,能云端异步执行,有Sub Agent架构和分段编译机制,或成未来软件工业新标准。
多模态后训练反常识:长思维链SFT和RL的协同困境
华为与香港科大研究发现,多模态视觉语言模型中,长思维链SFT与RL组合难协同增益。研究引入难度分类方法构建数据集,分析各方法表现及组合策略困境,还给出实验发现与未来研究方向。
从OpenAI离职创业到估值1700亿美元,Anthropic用4年时间引硅谷巨头疯狂押注
最新消息,Claude背后公司Anthropic即将达成新一轮融资50亿美元,总估值达1700亿,不到半年估值涨近3倍。该公司由前OpenAI员工创立,获亚马逊、谷歌等投资,其模型在代码生成领域优势明显。
Karpathy的编程经验Skills,开源了,Star涨疯了。
周末,Karpathy大佬的编程经验开源skills项目火了,它把其吐槽大模型写代码的问题编译成大模型可理解的约束。安装简单,还列举了一些规则示例。如今行业把人的经验编译成Agent可执行格式,开源范式改变。
减少检索增强生成(RAG)语义缓存中的误报:以银行业为例
文章围绕检索增强生成(RAG)语义缓存展开,指出其虽能提升效率,但设计不当会产生假阳性。以金融服务FAQ系统为例,经多组实验,发现缓存设计比模型优化更能减少假阳性,还给出未来架构路线图。
大模型能力,小模型成本!Google等 | 提出递归混合框架:MoR, 大幅提升LLM计算效率
Google提出递归混合框架(MoR),融合参数共享与自适应计算。它有轻量级路由和KV缓存策略,在不同路由机制各有优劣。实验显示,MoR在性能、计算和内存效率上表现出色,有望实现“大模型能力,小模型成本”。
一键式训练端到端Agent,Qwen3+MCP工具集高效集成!
RLFactory是开源的端到端RL后训练框架,将环境与训练解耦,用Qwen3基座调用MCP工具集,可低代码训练端到端Agent模型。它极致易用、训练高效,还支持一键式训练,未来会更易用高效。
肝脏也能“按需定制”?科学家研发新型植入物,让肝组织在体内自己长
哈佛大学怀斯研究所团队研发“BOOST”策略,结合组织工程与合成生物学,创造可在体内远程接收成长指令的工程化肝脏构建体,在动物实验中实现植入后按需扩增,为解决肝脏移植供体短缺带来新希望。