「AI强化学习」共找到 10539 篇相关文章

算法论文8

ACL 2026 | OPeRA Dataset: LLM真的能模仿人类行为了吗?首次系统评估LLM的人类行为模拟能力

美国东北大学等机构研究者提出OPeRA数据集,采集真实用户在线购物行为,支持系统评测LLM个体化行为预测能力。实验显示当前主流LLM在模拟人类行为上表现有限,揭示其能力边界。

机器之心
推荐文章8

硬核拆解 Hermes-Agent:自学习 Skill 机制的架构设计与实现原理。

文章围绕Hermes - Agent展开,指出多数Agent缺乏自学习能力,而它试图跨越这一鸿沟,能自动“写手册”(Skill)。介绍其架构、安装配置,通过代码审计任务演示自学习过程,并解析Skill机制,为生产级Agent提供新思路。

AI大模型应用实践
新闻资讯7

发 token 当工资?工程师不只拿现金和期权,开始按 token 分身价了

硅谷正用 token 吸引人才,国内也有类似趋势。AI 使用成本渐成人力成本关键,token 对应算力争夺,其价格上涨,大厂还想将 token 变成新价值单位,引发质疑。

InfoQ
开源动态8

最强开源搜索再升级,研究、预测能力实测超惊艳!

MiroMind团队发布新一代模型MiroThinker-1.7和MiroThinker-H1,定位为重型推理智能体。其研究能力强、推理可靠,还能生成网页报告。新版本升级显著,靠两项关键技术实现有效交互,且预测案例表现出色。

开源先锋
新闻资讯7

32岁程序员猝死引反思:应给“随时随地办公”设红线;内存条涨速超金条,100根可换上海一套房?DeepSeek工程师误点踩令程序员破防|Q资讯

本文为AI行业资讯汇总,包含32岁程序员猝死反思‘隐形加班’、TikTok官宣美国方案、内存条价格飙涨、燧原科技IPO获受理等热点,还有OpenAI、Meta等公司近期动态,以及行业会议推荐。

InfoQ
新闻资讯7

四问智谱上市|甲子光年

2026年1月8日,智谱AI在港交所上市。本文围绕其上市提出四问:是否为“中国OpenAI”、投资人押注点、商业模式健康度及“钱路”方向。指出它应卸下标签,回归技术与商业本质。

甲子光年
新闻资讯7

小扎忍痛,亲口宣告了元宇宙的死亡

扎克伯格的「元宇宙」执念向现实低头,Meta计划削减Reality Labs元宇宙部门人力,将资源倾斜至AI智能眼镜。此前Reality Labs四年亏超700亿美元,而智能眼镜销量火爆。

新智元
产品应用8

抛弃“级联”架构!快手OneRec用大模型重构推荐系统,服务成本降至1/10

传统级联式推荐架构有瓶颈,快手用OneRec重构推荐链路,服务成本降至1/10。文中介绍OneRec架构、Tokenizer方案、强化学习奖励设计,还提及优化及多模态联合训练方向。

InfoQ
开源动态8

美团杀入视频生成模型赛道,LongCat-Video 136亿参数媲美顶尖模型,效率提升10倍

美团LongCat团队发布LongCat - Video基础视频生成模型,有136亿参数量,多任务表现出色。它核心亮点多,还建立了数据处理流水线,采用特殊架构和训练方法,提升了生成效率,性能媲美顶尖模型。

AIGC开放社区
算法论文8

RLHF与RLVR全都要,陈丹琦团队最新力作将推理能力拓展到通用智能

普林斯顿大学陈丹琦团队发布学术成果,提出基于模型奖励思维的强化学习(RLMT)方法,弥合专门推理与通用对话能力差距,将链式思维优势扩展到更广泛范围,提升整体对话表现。

机器之心