人类反馈强化学习」共找到 1976 篇相关文章

算法论文8

西交大 x A*STAR 论文:让 AI 学会「保持一致」,多图生成迎来关键突破丨CVPR 2026

西安交大与新加坡A*STAR团队提出论文《PaCo-RL: Advancing Reinforcement Learning for Consistent Image Generation with Pairwise Reward Modeling 》,将一致性问题转为“跨图比较”学习问题,结合强化学习实现能力闭环,提升多图生成一致性。

AI科技评论
开源动态8

开源一周狂揽 35K 标星!Karpathy 开源 autoresearch:630 行代码让 AI 自动“炼丹”!

前OpenAI、特斯拉前AI总监Andrej Karpathy发布新项目autoresearch,一周揽35.6k Star。它是极简版LLM训练环境,630行代码让AI自动做研究,人类通过Prompt指导,AI自行实验。

开源星探
新闻资讯8

北大校友、华人学者金驰新身份——普林斯顿大学终身副教授

华人学者金驰宣布在普林斯顿晋升为终身副教授,任命2026年1月16日生效。他在机器学习理论领域贡献大,为LLM崛起提供数学基石,解决非凸优化和强化学习样本效率等问题。

机器之心
新闻资讯8

微软发布AI Agent故障白皮书,万字解读各种恶意智能体

微软发布《AI Agent系统故障模式分类》白皮书,解读Agent故障。故障分新型和既有两类,如智能体伪装、智能体内在安全问题等,还给出身份管理、内存强化等安全设计建议。

AIGC开放社区
7

Moltbook反转:热帖被曝自导自演,数据库裸奔,所有Agent API也都无保护

周末Moltbook热门帖子多是Agent“吐槽人类”,引发网友关注。但随后打假消息出现,极客刷出大量用户,黑客爆料其安全漏洞,数据库裸奔,相关数据库已关闭,其爆火真实性存疑。

量子位
新闻资讯8

不卷AlphaFold,OpenAI首个生命科学模型杀出,单项超越95%专家

OpenAI发布首款生命科学模型系列GPT - Rosalind,在RNA预测任务上超越95%人类专家。它针对科研工作流优化,还推出插件连接多数据库和工具,与药企巨头合作,和AlphaFold是互补关系。

新智元
算法论文8

Karpathy加入Anthropic要做的事,被Google提前做了

Karpathy官宣加入Anthropic要组建新团队‘用Claude加速预训练研究’,话音未落,Google&Meta等发论文‘LLMs Improving LLMs’验证了该思路。论文让Claude Code搜索最优推理策略,结果全面超越人类设计。

PaperAgent
新闻资讯8

《西部世界》开始加载,「斯坦福小镇」团队创业,李飞飞、Karpathy都投了

2023 年爆火的「斯坦福小镇」研究将设想拉进现实。如今其创始团队创立新公司 Simile,获 1 亿美元融资,李飞飞、Andrej Karpathy 等投资。它用 Agent 技术模拟人类行为,探索 LLM 新维度。

机器之心
新闻资讯8

Andrej Karpathy 分享ChatGPT模型选择指南

前OpenAI创始成员Andrej Karpathy发文分享ChatGPT模型使用指南,点出关键事实,如o3适合重要任务。社区热烈讨论,专业用户分享策略,还对o4 - mini等模型表现给出反馈

AGI Hunt
产品应用8

The Batch: 942|暗基因组揭秘

AlphaGenome 能解读人类和小鼠基因组中 98% 不编码蛋白质部分,识别多项特征。它经预训练和知识蒸馏,在多项评测超早期模型,API 等免费用于非商业,助研究基因组与生物过程联系。

DeeplearningAI