「自奖励训练」共找到 3112 篇相关文章
OpenAI惊人自曝:GPT-5真「降智」了!但重现「神之一手」,剑指代码王座
GPT-5发布后引发热议,其IQ测试成绩不佳遭吐槽,但实际是「路由」问题。解锁神级GPT-5关键在prompt,医学家借它重现「神之一手」。它编程能力强,挑战Anthropic,还推动AI向「智能体式推理」发展。
老黄自曝刚报废50亿美元显卡!亲自审查4.2万名员工薪酬,100%都加薪
黄仁勋在采访中透露报废50亿美元显卡,坚持先下单先得分配H100芯片。他亲自审查员工薪酬,称100%会加薪。认为AI是伟大“技术均衡器”,天价AI合同合理,还谈及芯片保值、中美AI竞赛等话题。
一招缓解LLM偏科!调整训练集组成,“秘方”在此 | 上交大&上海AI Lab等
上海交大和上海AI Lab联合团队提出IDEAL方法,可提升LLM综合性能。研究发现SFT阶段数据数量非关键,配比不当会加剧模型“偏科”。以Llama3.1 8B测试,IDEAL能提升代码能力,还指导了超参数选取。
OpenAI 早期董事会成员:算法与神经网络成“超能架构”,我们如何自处?|文末赠书
OpenAI 早期投资人里德·霍夫曼新书《AI 赋能》中文版推出。书中提出 AI 应是放大人类行动力的工具,还阐述“超级能动性”概念,强调技术与人类深度共生,批判盲目创新,主张技术锚定人文价值。
泛化性暴涨47%!首个意图检测奖励范式,AI工具爆炸时代意图识别新解法
随着大模型和工具增长,AI 助手意图识别遇新挑战。腾讯 PCG 团队用强化学习等方法,提升模型泛化能力,还从多方面剖析优势,最后提出未来研究方向。
15岁进少年班,97后打造「元点机器人宇宙」:全栈技术自研领跑家庭机器人赛道
元点Zeroth发布全尺寸人形Jupiter和异构机械臂家庭协作机器人N1,强调与人类长期共生关系。其创始人是97年的郭人杰,公司已累计融10亿。元点有全栈技术体系,走渐进式落地路线。
又一个Kimi K3下周开源!Qwen3.8-Max编程、办公、科研都能自己干了
Qwen3.8-Max是Qwen家族迄今最强模型,2.4万亿参数,下周将开源权重。它在多项基准测试中表现出色,能连续自主工作数天,在编程、办公、科研、长周期任务、多模态等方面全面提升。
自回归因果注意力也能并行解码?上交联合UCSD突破LLM推理瓶颈,模型代码全开源
大语言模型推理速度是应用瓶颈,传统方法各有弊端。上交和UCSD团队提出Jacobi Forcing方案,无需重构架构,将AR模型转为并行解码器,提速显著且质量损失小,核心优势多,技术路线全链路优化,实测表现优。
LLM内部竟藏着众多策略模型?自所&腾讯团队首次揭示大模型RL新机制
中国科学院自动化研究所与腾讯AI Lab团队,从可解释性分析出发,发现LLM内部含多个可采样内部策略,揭示不同模型推理熵模式,提出BuPO算法,在复杂推理任务上表现优于传统算法。
Anthropic自研AI面试官,深度访谈1250名职场人,揭示AI在工作中的真实影响
Anthropic发布Anthropic Interviewer工具,对1250名专业人士访谈。结果显示,人们对AI在工作中的作用普遍乐观但局部悲观,不同职业群体对AI态度和使用情况有差异,研究数据将公开。