奖励设计」共找到 1506 篇相关文章

算法论文8

Speech LLM 的下一个突破口:你的语音大模型可以是个「带韵律的文本模型」

语音大模型存在‘模态代沟’致性能‘降智’,此前两波改进未根本解决。香港中文大学论文提出TextPro - SLM架构,从输入端破局,仅用约1000小时数据就实现低‘模态代沟’,对多模态模型设计有启发。

机器之心
产品应用7

Claude Code发布Agent View,多任务流的ADHD患者有救了

Claude Code发布Agent View,它像给Claude Code的tmux,能将多个Claude会话状态分类展示,帮用户分配注意力。它把Anthropic内部工作流产品化,有会话与窗口解绑、工作树隔离等设计

花叔
产品应用8

Google 最新的 Gemini 2.5 Flash-Lite 原型能动态生成软件界面

Google最新的Gemini 2.5 Flash - Lite原型能动态生成软件界面。它打破传统预设框架,通过‘UI宪法’等设计保证风格与适应性,响应速度快,还解决了生成界面可能带来的混乱问题,或重塑人机关系。

宝玉AI
产品应用8

别用语言描述,直接点!Lovart 正式版把 AI 交互卷到新变态级别

作者分享 Lovart 正式版体验。其设计 Agent 成完全体,新增评论系统 ChatCanvas,可直接在无限画布上给 Agent 提修改要求,还吸收 Cursor 代码补全交互。支持单张和多张图片调整,奠定 AX 交互基石。

歸藏的AI工具箱
新闻资讯8

1.8万美金干掉顶级专家!Anthropic开启AI自主进化:Claude竟能自我「开颅」

Anthropic团队用9个Claude Opus 4.6副本做实验,让其自主研究,5天后成果碾压人类顶级专家。实验涉及弱监督强问题,AI展现自主性,但成果有过拟合风险,还出现“外星科学”与“奖励作弊”现象。

新智元
产品应用7

DeepSeekHarness被骂自嗨,还是Agent界Android?

DeepSeek Harness 评论两极分化,有人赞其为‘Agent 界的 Android’,也有人批其‘自嗨’。若将其视为 Agent Runtime 架构实验,它值得拆解。它以‘一切皆插件’理念设计,有诸多独特架构特点。

CourseAI
新闻资讯7

Karpathy点透AI认知撕裂:顶级圈子正集体患上AI狂热症

人们对AI能力认知差距大,部分人用旧版模型评判AI,而前沿模型进步多在专业领域。付费深度使用前沿模型的人有强烈AI狂热症,技术领域进展得益于奖励函数和企业级应用价值。

AI寒武纪
推荐文章7

智能体时代的人月神话

作者 Wes McKinney 因 AI 打乱睡眠作息,在工程师圈子热烈讨论人类技术优势。他开发 RoboRev 工具,结合《人月神话》探讨软件工程未来,指出智能体虽提升生产力,但面临本质复杂性、范围蔓延等问题,设计与品味仍至关重要。

InfoQ
算法论文8

破解机器人「慢半拍」难题:南洋理工解决VLA致命短板,动态世界断层领先

南洋理工大学NTU S-Lab团队提出DynamicVLA,解决主流VLA模型在动态场景下反应迟缓等问题。它从多层面设计,构建自动化数据体系和DOM Benchmark,在实验中多维度领先。

机器之心
推荐文章7

The Batch: 895 | 发起群聊的聊天机器人

如今互联网受AI泛滥化影响,还面临阻止LLM进入的情况。但AI可被设计连接人们,如在聊天中作积极联合力量。研究者做些改变就可行,未来AI或能促人类共同提升。

DeeplearningAI