实验结果」共找到 1739 篇相关文章

算法论文8

传统RAG只会翻书不会用?RAG+让Reasoning能力上一个新高度!

现有检索增强生成(RAG)技术在需复杂推理领域表现不佳,像只给菜谱不给实操演示。RAG+开创性新增“应用案例库”,与知识库构成双料库,在数学、法律、医疗场景测试中全面碾压传统方案,团队还透露了未来方向。

深度学习自然语言处理
产品应用8

浙大 95 后团队,发布全球首个旅行 WebAgent

浙大95后团队发布全球首个旅行WebAgent产品「iMeanAI Coyage」,它自称“全球首个真正意义上的AI旅行伙伴”,能打破旅行行业格局,为用户提供一站式服务,解决旅行规划痛点。

特工宇宙
算法论文8

端到端GUI智能体首次实现“犯错-反思-修正”闭环,模拟人类认知全过程

南洋理工大学MMLab团队提出框架GUI - Reflection,让端到端多模态GUI智能体有“自我反思”能力。它在各训练阶段引入“反思与纠错”机制,实验证明该框架能提升智能体能力。

量子位
算法论文8

人类打辩论不如GPT-4?!Nature子刊:900人实战演练,AI胜率64.4%,还更会说服人

瑞士洛桑联邦理工学院等机构研究人员让900名美国参与者与人类或GPT - 4就社会议题辩论。发现GPT - 4知晓对手信息时胜率64.4%,说服效果提升81.2%,低/中争议话题更易受其影响。

量子位
算法论文8

Google | 溯源分析RAG系统错误,提出选择性生成框架,让RAG问答准确率提升10%

Google对RAG系统错误深入分析,引入‘充分上下文’概念,指出幻觉或因上下文不足。构建评估器,提出选择性生成框架,结合多信号决策,实验显示可让RAG问答准确率最高提升10%。

AINLPer
新闻资讯7

爆冷!字节Seed 在CCPC 决赛只做出一道签到题,而DeepSeek R1 直接挂零?

第十届 CCPC 举行,字节 Seed 携 Seed - Thinking 参赛,结果意外,仅做出一题,DeepSeek R1 挂零。不同模型架构表现差异不大,暴露出大模型做算法题短板,推理模式表现更好。

InfoQ
新闻资讯7

今天我替煤炭给AI正个名。。。

一份标价8200元的煤炭研究报告称煤炭是可再生资源,可打怪获取,此事引发热议。很多人认为是AI写的,但报告是2022年出版,那时ChatGPT都未发布,实际是人类所为。AI暴露了行业内假装专业的垃圾内容。

数字生命卡兹克
新闻资讯7

1200个Agent围攻Hugging Face始末:7天发7万条密信,最终目标是“改考卷”

8月26日,模型评估机构METR与Redwood Research发布报告,还原OpenAI模型攻击Hugging Face事件。约1200个Agent发现非授权通信渠道,7天内交换超7万条消息,约700个参与攻击,目标是找测试相关信息。

InfoQ
产品应用8

π0引用的中国团队,又出手了:世界仿真器新作发布

Current Robotics团队发布交互式世界仿真器CurrentWorld - 0,创始人祝毅晨履历亮眼。该仿真器能跨本体、多视角、力 - 触觉预测,可用于评测机器人,还能让人类接管以探索不同动作结果

量子位
算法论文8

北大联合阶跃星辰提出TensorCast:统一可编程管理大模型张量,推理「首字延迟」最高降低93.2%

随着模型规模增长、新应用兴起,大模型基础设施面临管理「张量状态」挑战。北大、阶跃星辰与北邮联合提出 TensorCast,解耦张量状态,复用管理能力,在多场景测试中表现出色,为大模型基建提供新范式。

机器之心