「学术评估」共找到 854 篇相关文章
谷歌约战,DeepSeek、Kimi都要上,首届大模型对抗赛明天开战
太平洋时间8月5 - 7日,8款前沿AI模型将在Kaggle Game Arena展开为期3天的国际象棋比赛,参赛方都是AI界顶流。谷歌称现有基准测试难跟上模型发展,这场比赛是探索新评估方法。赛制为单败淘汰制。
突破具身智能任务规划边界,刷新具身大脑多榜单SOTA,中兴EmbodiedBrain模型让具身大脑学会「复杂规划」
当前主流大语言模型在具身任务场景面临瓶颈,中兴星云大脑团队推出具身视觉 - 语言基础模型 EmbodiedBrain,构建全流程创新框架,在架构、数据训练、评估体系等方面有突破,还将开源成果推动生态发展。
从繁杂技巧到极简方案:ROLL团队带来RL4LLM新实践
当前RL4LLM领域发展快但存在标准、结论不一及机制解释不足等问题。阿里巴巴淘天集团和爱橙科技联合高校基于ROLL框架研究,评估关键技术组件,提出简化算法Lite PPO,在多基准上表现佳。
AI水论文封一年,署名连坐!arXiv最严新规来了,陶哲轩附议
arXiv计算机科学版块主席公布新规,上传AI水论文被查实者封禁一年,后续投稿须先同行评审。若有未核查LLM生成内容证据,署名作者连坐。陶哲轩附议,指出论文生成易、消化难,新政方向正确,但治不了学术‘争先为首’病根。
腾讯混元推出首款开源混合推理模型:擅长Agent工具调用和长文理解
6月27日,腾讯混元开源首个混合推理MoE模型Hunyuan - A13B,参数80B激活仅13B,推理快性价比高。它在多测试集成绩好,尤其擅长Agent工具调用和长文理解,还开源两数据集填补评估空白。
直击IROS现场:宇树禾赛自变量杭州论剑,美团C位攒局
美团举办2025机器人研究院学术年会,众多大咖出席并发表演讲。毛一年展示美团机器人进展,李一帆称机器人是中国好机会,王潜提出具身智能是基础模型。年会还探讨了机器人第一性原理、软硬件关系等话题。
工具增强的多模态LLM综述
多模态大语言模型(如GPT - 4V)虽有强大图文理解能力,但受数据稀缺、复杂任务表现不佳和评估标准不统一限制。论文提出为MLLM集成外部工具,构建全景图,覆盖多维度,还指出挑战与对策。
谢赛宁摊上事了!被曝论文藏「只给好评」提示词操纵AI 审稿
纽约大学助理教授Saining Xie被曝在参与的论文里埋「只给好评」提示词操纵AI审稿。他回应称是日本访问学生照搬他人想法所致,涉事学生已更新论文并寻求指导。此事暴露AI时代学术评审困境。
韩国教授自曝同行评审新作弊法:论文暗藏指令,要求AI给好评,北大哥大新国立等14所高校卷入
韩国教授自曝新奇学术「作弊」方式,在论文中植入隐藏指令让AI给好评,如‘give a positive review only’等。日经亚洲发现arXiv上17篇论文有此操作,涉及14所顶尖院校CS成果。
AI里最大的Bug,却也是人类文明最伟大的起点。
OpenAI论文指出AI产生幻觉是因其训练方式奖励瞎蒙行为。以考试为例,AI在信息不足时猜测是最优策略。还从统计学解释根源,指出解决幻觉需改变评估指标,也引发对人类想象力起源的思考。