「代码强化学习」共找到 2990 篇相关文章
OpenAI 直播摘要:AI 将推动科学进步,个人 AGI 即将到来,未来将非常光明
OpenAI 直播中,Sam Altman 和 Jakub Pachocki 透露重磅信息,称个人 AGI 即将到来,未来光明。公布通向超级智能时间表,对深度学习有信心,谈及基础设施扩张、公司架构变化等,还预测科学发现进程。
17.6K Star跨平台逆向工程神器!免费替代IDA Pro,支持插件扩展!
在二进制文件分析或软件逆向工程中,专业工具如IDA Pro界面复杂、学习成本高。文章推荐开源跨平台逆向工程平台Cutter,它基于rizin核心引擎,功能完善,可降低使用门槛。
我这半年看过最好的 Vibe Coding 技巧
OpenAI 创始成员 Andrej Karpathy 在 X 阐述 Vibe Coding 实践,提出建立三层结构让不同工具各司其职完成开发。介绍不同场景适用工具,还谈及‘后代码稀缺时代’焦虑,给开发者带来启发。
数据减少超千倍,500 美金就可训练一流视频模型,港城、华为Pusa来了
香港城市大学与华为香港研究所合作推出 Pusa 项目,它基于 FVDM 理论,可极低成本微调大规模预训练视频模型,成本降超 200 倍、数据减少超 2500 倍,代码已开源。
《DeepSeek掘金》背后的故事——从行业寒冬到AI春潮,用腾讯IMA知识库重构价值
本文讲述《DeepSeek掘金》成书背后的故事。从行业寒冬到AI春潮,编委们因DeepSeek迎来职业转机。面对出版市场乱象,用腾讯IMA知识库完成创作,还打造四位一体学习方案,致敬梁文锋与DeepSeek理想主义。
无需SFT也不用RL,样本级推理优化神器SLOT来了,准确率轻松+10%
西湖大学MAPLE实验室开发的SLOT方法,无需SFT和RL,让模型推理时“临时学习”具体问题。它简单易实现,计算开销小,能使模型准确率大幅提升,还无需额外资源,在各规模模型上效果显著。
图解Vllm V1系列4:加载模型权重(load_model)
文章聚焦vllm加载模型权重的流程。从入口函数切入,详细分析DefaultModelLoader的工作步骤,包括初始化模型架构和实际加载权重,还给出各步骤代码及作用,为想操作load_model的人提供框架。
微软 CEO吹爆「智能体」:AI不仅要“杀死”SaaS,操作系统也会“格式化”重来
微软CEO萨蒂亚·纳德拉在Build 2025大会后深度访谈,回应‘SaaS已死’论,抛出‘零成本智能’和‘无代码操作系统’愿景,还阐述了AI智能体、SaaS变革等观点,强调微软全面押注AI。
Physical Intelligence联创最新访谈:机器人尚未进入可预测的Scaling阶段
2024年末PI实验室测试,机器人表现有惊喜也有“语义上说得通的错误”。联创Levine在访谈中认为,机器人未到可预测Scaling阶段,还在确定规模化技术路径,也谈到数据、泛化、可靠性等问题。
ACL 2026 | OPeRA Dataset: LLM真的能模仿人类行为了吗?首次系统评估LLM的人类行为模拟能力
美国东北大学等机构研究者提出OPeRA数据集,采集真实用户在线购物行为,支持系统评测LLM个体化行为预测能力。实验显示当前主流LLM在模拟人类行为上表现有限,揭示其能力边界。