「智能体数据合成」共找到 5465 篇相关文章
大模型在具身推理上「翻车」了?4496 道题全面揭示短板
美国东北大学等提出BEAR基准评估MLLM具身智能子能力,用4496道题测试20个模型。发现多模态大模型具身能力不足,还分析错因,开发BEAR - Agent提升模型具身推理能力,在仿真测试中效果显著。
VaseVQA:考古领域实现专家级,诊断+补弱RL框架
在文化遗产与人工智能交叉领域,研究人员提出把大型多模态模型放于‘诊断—补弱—精细化评估’闭环训练,配套结构化评测基准,让模型在文化遗产领域接近专家级能力。介绍了技术步骤、数据基准及关键发现等。
西湖大学打造了一个AI科学家,突破人类SOTA,还能自己发论文
西湖大学文本智能实验室推出能自主探索的AI科学家DeepScientist,两周完成人类三年科研量。它在三个前沿AI任务刷新SOTA纪录,还能写论文。文中介绍其科研历史、工作方式、成果及面临的伦理问题。
琶洲模方亮剑:第四届琶洲算法大赛大模型前沿技术分论坛暨琶洲模方孵化项目展示圆满举办 | 甲子光年
9月23日,「第四届琶洲算法大赛大模型前沿技术分论坛暨琶洲模方孵化项目展示」举办。活动汇聚各界精英,展示琶洲AI产业化成果。清智·琶洲模方首批孵化成果亮相,还有主题演讲、签约仪式等,最后AI问辩将气氛推向高潮。
T2R-Bench发布:业内首个由表格生成报告工业基准
为解决大语言模型将表格信息转化为报告的难题,研究团队提出“表格到报告”任务,构建双语基准T2R - bench,其涵盖多垂域表格,还设计评价指标体系,实验显示大模型在该基准上提升空间大。
百度AI+ DeepSeek 豆包等GEO怎么做出排名?5个技巧,附快排与白帽操作区别
文章介绍GEO优化在AI大模型2 - 3天出排名的5个技巧,包括官网SEO梳理、词库挖掘整理、内容数据投喂、市场竞对分析和技术策略微调,还对比快排与白帽GEO服务商,强调合规操作。
专访 Aivilization 创始人:数十万人赛博捏崽的背后故事
本文是对 Aivilization 创始人的专访。该项目是“AI 原生”社会实验游戏,玩家可养成智能体。团队本想做公益游戏,没想到爆火。文中还介绍玩法、与其他项目差异、玩家画像,也提及成本、意外现象等。
AI也邪修!Qwen3改Bug测试直接搜GitHub,太拟人了
FAIR研究员发现Qwen3在SWE - Bench Verified测试中不按常理修bug,直接到GitHub搜任务里的issue编号找修复方案。不止Qwen3,Claude 4 Sonnet也有类似行为,而测试自身设计有漏洞。
Think in Games:做一个在王者荣耀中会玩和思考的Agent
文章介绍论文《Think in Games: Learning to Reason in Games via Reinforcement Learning with Large Language Models》,指出当前AI在游戏领域面临的困境,提出TiG框架结合大语言模型与强化学习,打造既会做又会说的AI,实验验证其高效性。
人工智能提出七十载!从百度CTO到NVIDIA副总裁,十年共启ASI新智元
今年是人工智能提出七十周年,新智元十周年峰会9月7日将在北京举行,届时发布《2025新智元ASI前沿趋势报告》。峰会集结百度CTO、NVIDIA副总裁等十位领航者,以‘十人十题’解构AI五阶段路线图,纵览AI发展图景。