推理场景」共找到 3750 篇相关文章

算法论文8

普林斯顿发现RLHF显著加剧了LLM胡扯!

普林斯顿研究提出‘机器胡扯’概念,构建分析框架,含胡扯指数、行为分类法和评测集。实验揭示RLHF加剧胡扯,政治语境模型爱‘打太极’,为构建诚实AI提供工具和理论。

深度学习自然语言处理
新闻资讯7

OpenAI谷歌Anthropic罕见联手发研究!Ilya/Hinton/Bengio带头支持,共推CoT监测方案

OpenAI、谷歌DeepMind、Anthropic联合发表立场文件,提出CoT监测概念,认为是控制AI Agent核心方法。探讨其潜在机遇、局限,还提及不同公司对CoT监测的不同态度,如OpenAI乐观,Anthropic焦虑。

量子位
开源动态8

大模型首次直接理解代码图:不用Agent自动修bug,登顶SWE-Bench开源模型榜单

蚂蚁开源新模型CGM,首创将仓库代码图模态融入大模型,不依赖闭源模型和复杂Agent,仅需4步就能快速定位、生成补丁。它在多个测试基准中领先,技术论文等均已开源。

量子位
产品应用7

Cursor 定价更新:Pro 不再限 500 次,取消工具调用限制,还推出 $200 Ultra。

Cursor进行定价更新,推出200美元/月的Ultra计划,使用量是Pro的20倍。Pro计划默认改为有速率限制的无限请求,也能切换回旧的500次快速请求模式。还推荐了4个开源LLM微调库。

AI进修生
新闻资讯7

这届机器人太会了!百事蓝宝出道,人形机器人也开始卷情绪价值了

百事可乐首个人形机器人「百事蓝宝」出道,与贝克汉姆等互动表演。AI和硬件进步使机器人走入生活,它迎合年轻人情绪价值需求,其诞生是百事与智元价值共振,未来将创造更多惊喜。

新智元
算法论文7

奖励是假的,能让Qwen提升25%性能却是真的!

华盛顿大学博士生团队用Qwen模型对虚假奖励进行RLVR,使MATH - 500准确率显著提升约25%。研究发现RLVR不考虑奖励正确性,还分析了虚假奖励有效的原因,提示现有研究要在非Qwen模型验证。

量子位
算法论文8

InfoDeepSeek:首个开放网络环境下的智能体信息搜寻质量评估基准

上海交通大学与华为诺亚方舟实验室联合推出InfoDeepSeek,它是首个评估真实动态网络环境下智能体信息搜寻质量的基准。该基准有挑战性问题、真实动态环境等亮点,还开展实验揭示智能体行为特性。

AI科技评论
开源动态8

字节开源高效解析文档图像的新型多模态模型Dolphin,快速将复杂的文档图像转化为结构化数据。

字节开源新型多模态模型Dolphin,采用“先分析后解析”范式,能将复杂文档图像转化为结构化数据。它有卓越性能和多种特性,还提供安装、推理使用指南。

GitHubStore
算法论文8

ICRA 2025|通用多机器人长时任务规划框架破解任务分配难题,成功率+105%、效率+36%

2025年5月,美两校联合团队在ICRA 2025发布LaMMA - P。它融合大模型与PDDL规划器,解决异构多机器人长时任务分配难题,在新基准数据集上,相比SMART - LLM,任务成功率提高105%,执行效率提升36%。

机器之心
推荐文章8

MCP 已死?不,它正在进化:三个关键变化

本文针对网传“MCP已死”的说法,解读最新版MCP模型上下文协议的三大核心变化,对比MCP Tasks与A2A的区别,给出选型建议,帮助开发者适配企业级Agent场景需求。

AI大模型应用实践