「强化学习范式」共找到 2270 篇相关文章
为了「自我锤炼」,OpenAI 造了一个攻击力极强的「AI 黑客」
OpenAI宣布扩展网络安全计划Daybreak,推出GPT‑5.6‑Cyber,分蓝队和红队。红队模型模拟黑客找漏洞,能力强悍,高危安全任务完成率达95%。但此举也带来安全风险,OpenAI采取分级授权等措施。
VLM会描述视频,却未必用对参考图:RefCaptioner让参考图与视频语义精准对应
多模态大模型处理多参考图与视频对应关系能力不足。为此提出 RefCaptioner,强化模型对参考图识别感应能力、优化输出格式与奖励函数;还构建 MRVBench 评测基准,实验显示其表现优异。
对话涌生智能杨梦:AI for Bio的下一场竞争,是把实验闭环验证真正做出来
随着科技巨头进入生命科学领域,AI for Bio竞争升级,焦点转向模型能否进入科研流程。涌生智能与上海人工智能实验室发布成果,为跨越鸿沟提供新路径。对话涌生智能杨梦,探讨相关技术路径、产业思考等。
AI视觉创作总差点意思?中科大等综述500+篇文献,系统分析生成一致性
中国科学技术大学等多机构研究者发表综述,梳理超500篇论文,揭示扩散模型视觉内容合成“一致性危机”,介绍三类一致性关系、加强位置、评估问题,指出未来模型需具备冲突感知等能力。
Anthropic创始人行动手册:打造一家AI-Native创业公司(附36页中文PDF)
Anthropic上周发布《创始人行动手册》,介绍AI时代打造AI - Native创业公司的方法。手册按创业四阶段展开,阐述各阶段目标、挑战及Claude工具的使用,还给出资源、案例和创业支持信息。
兼顾效率、成本与能力,百灵开源旗舰推理模型 Ring-2.6-1T
5月15日,蚂蚁百灵开源旗舰级推理模型Ring-2.6-1T,权重文件上线Hugging Face、ModelScope平台。该模型有万亿参数,‘按需思考’,在代理执行、推理机制、训练范式三方面升级,评测表现出色。
ICLR 2026 | ProSafePrune:一剪见效,告别大模型过度防御
合肥工业大学与科大讯飞联合团队提出全新低秩参数修剪框架 ProSafePrune,被 ICLR 2026 录用。它能精准定位模型认知偏差并修剪,降低过度拒绝率,不损安全防御能力,还提升通用任务性能,为 LLM 安全部署提供新思路。
3000行代码长出无限技能:AI Agent自我进化时代来了
4月17日GitHub Trending上,Evolver和GenericAgent两个“自我进化”Agent框架登上热榜。Evolver用“基因进化”让提示词自动升级,GenericAgent以3000行种子代码长出独有技能树,二者代表不同进化范式。
极客部落“OPC 创业者招募计划”正式发布,赋能 AI 时代“一人独角兽”
3月20日,极客部落“OPC创业者招募计划”开放日活动举行,聚焦AI时代OPC创业范式。活动揭牌“极客部落·AI应用生态园”,宣讲扶持政策,发布合作基金,探讨OpenClaw对创业生态影响,助力创业者成长。
手残党跪了,Pi 0.6机器人15分钟学会拧螺丝,能进厂边干边学了
具身智能领域 Physical Intelligence 公布新进展,借助「RL token」法,让机器人短时间掌握精细操作。该方法给 VLA 加「外挂」,使机器人进化快、学习效率高,在多项任务测试中表现出色。