协作评估」共找到 1193 篇相关文章

算法论文7

OpenAI新幻觉论文惹争议!GPT-5拉胯是测试基准有问题??

OpenAI新论文《语言模型为何会产生幻觉?》提出,模型有幻觉是因标准训练和评估流程倾向奖励“猜对”。GPT - 5不爱猜测,在榜单表现不佳,网友质疑论文是为GPT - 5挽尊,论文引发网友多方向讨论。

量子位
新闻资讯8

Demis Hassabis揭秘世界模型Genie 3的真正意义:为AGI打造无限“虚拟子宫”

Google DeepMind CEO Demis Hassabis与产品负责人深度对谈,爆料将游戏智能体SIMA放入Genie 3生成世界训练,探讨AI从游戏到思考系统的演进、Genie 3意义及AGI评估挑战,还提及与Kaggle合作推游戏竞技场。

AI寒武纪
开源动态8

3B模型性能小钢炮,“AI下半场应该训练+验证两条腿跑步”丨上海AI Lab&澳门大学

上海AI Lab和澳门大学联合发布通用答案验证模型CompassVerifier与评测集VerifierBench,填补Verifier领域循环迭代体系空白。AI下半场评估比训练更重要,当前验证方法有困境,新模型验证精度高且能用于强化学习。

量子位
新闻资讯7

“现在的AI就像1880年的笨重工厂!”微软CSO斯坦福泼冷水:别急着造神

微软首席科学官 Eric Horvitz 在斯坦福商学院演讲,称当下 AI 如 1880 年代刚用电的工厂,底层大模型与商业未契合。他指出模型概率校准不足、医疗 AI 难移植等问题,还谈及人类与 AI 协作及内容溯源等。

AI科技大本营
算法论文8

推荐系统进入「双动力」时代!首篇LLM-RL协同推荐综述深度解析

强化学习是推荐系统主流建模范式,但传统 RL 推荐系统有诸多瓶颈。大语言模型崛起带来新机遇,LLM 与 RL 结合开启新范式。研究团队发布首篇相关综述,提出五大协同范式,总结评估体系,分析挑战与方向。

机器之心
开源动态8

腾讯开源混元Image 2.1:2K高清+完美文字嵌入,图文天花板来了

今天凌晨,腾讯开源最新图像模型混元Image 2.1,支持原生2K分辨率与长提示词,文字嵌入能力强,适用于专业场景。还开源加速版模型权重和提示词改写模型,评估显示其性能达开源最优,接近闭源商业模型。

AIGC开放社区
新闻资讯7

ChatGPT新功能,又干掉一批创业项目

ChatGPT推出新功能分支对话,点击按钮就能在原对话基础上岔话题。此前不少创业公司主打此功能,如T3.chat。该功能已上线,对团队协作有用,网友提改进建议。此外,“项目”功能也免费开放,不同用户文件上传限制不同。

量子位
新闻资讯7

初稿抢先看!13家单位共同起草全国首部AI大模型私有化部署标准智合标准化建设

由智合标准中心组织起草的《人工智能大模型私有化部署技术实施与评价指南》团体标准立项,这是国内首部相关标准。它全流程覆盖、多方面融合、三方协作,能解决企业痛点,现征集起草单位和人,5月15日开研讨会。

AI工程化
算法论文8

首个地球科学智能体Earth-Agent来了,解锁地球观测数据分析新范式

上海人工智能实验室与中山大学联合研发的 Earth - Agent 解决了多模态大语言模型用于地球科学研究的痛点。它将领域知识工具封装化,利用 LLM 智能规划调度。经 Earth - Bench 评估,其在多方面表现出色,未来发展前景广阔。

机器之心
产品应用8

RecGPT-阿里的LLM推荐系统落地方案

文章介绍阿里RecGPT推荐系统落地方案,包括召回和推荐可解释性两方向。召回采用三塔结构,通过挖掘用户兴趣生成商品标签提升召回多样性。还提及行为序列压缩、推荐归因等,以及大模型微调和评估方法。

王喆的AI笔记