「00后开发者」共找到 3068 篇相关文章
Cursor Composer 2.5 拆解:最强大的 RL 环境,就是你自己的产品
今年5月,Cursor推出Agentic编程模型Composer 2.5,相比前代能力更强、成本效率更高。Cursor研究负责人认为最强大的RL环境就是自己的产品,文中还介绍了Composer 2.5训练方式、面临的挑战及解决办法等。
Opus 4.5之后,AI正在催生“巨头型百人公司”
Opus 4.5发布后,Agent赛道洗牌,模型差距由Agent Loop拉开。本文围绕Cherry Studio,与创始人及投资人探讨AI公司护城河、开源意义、用户价值差异等,指出未来将催生“巨头型百人公司”。
DeepMind华人研究员Lun Wang离职,「评估」成制约模型能力飞跃的瓶颈
谷歌DeepMind研究员Lun Wang离职后发文指出,当下评估体系难以应对新模型,制约模型能力飞跃。现有评估多针对当前模型,新能力出现时往往无法预测,需构建能自我进化的评估系统。
林俊旸果然创业了!一个“Qwen负责人”头衔值135亿
前阿里千问大模型负责人林俊旸离职后创业,种子轮目标估值20亿美元。他曾深度参与阿里多个大模型项目,离职首篇长文提出“Agentic Thinking”,或为创业方向。
7300 人收藏的 PraisonAI,5 行代码即可部署 24 小时 AI 智能体团队!
PraisonAI是开发者Mervin Praison开源的全功能多智能体运行框架,有7.3K+ GitHub星标。它开发门槛低,支持100+大模型,具备完整智能体能力,还能可视化编排、一键接入聊天平台。
蚂蚁开源 x SGLang Meetup技术回放解读之基于CUTE DSL的通信计算重叠算子实践
文章是对蚂蚁开源x SGLang Meetup分享的回放解读,聚焦基于CuTe DSL的通信 - 计算重叠内核实践。探讨不同通信计算重叠方案,分析在Blackwell上做GEMM + AllReduce融合算子的优势,介绍multimem指令等,还提及接入模型执行路径和性能结果。
Boris Cherny:Claude Code 之后,写代码正在变成“管理 Agent”
这是对Anthropic内部Claude Code创建者Boris Cherny的访谈。他介绍了Claude Code从三人孵化项目发展的历程,分享工作流,探讨编程现状、SaaS未来、产品与模型关系等,还给出软件大众化等观点。
强化学习的进化:从PPO到MaxRL,LLM推理训练的算法演进史
本文概述2024 - 2026年推理LLM的强化学习进展,从REINFORCE和PPO讲起,介绍GRPO、RLOO等多种算法。指出critic模型非必需,标准差归一化有副作用,损失聚合很关键,信任域是优化切入点,还提出几个未解决的挑战。
重新审视SFT的泛化能力:优化动态、数据与模型能力的条件性分析
上海人工智能实验室等联合研究质疑了‘SFT倾向于记忆,RL实现泛化’观点,指出SFT泛化是条件性现象,受优化动态、训练数据、基模型能力影响,还揭示长思维链SFT会带来安全性能退化。
魔法原子登陆硅谷,行业首个「自进化具身大脑」发布
美西4月28日,国内具身智能企业魔法原子在硅谷主办全球具身智能创新大会。会上发布全域世界模型Magic - Mix、新一代灵巧手H01、旗舰人形机器人MagicBot X1,直面行业痛点,还披露全球化战略目标。