「看表测试」共找到 2211 篇相关文章
LeCun世界模型出2代了!62小时搞定机器人训练,开启物理推理新时代
Meta开源发布V-JEPA 2世界模型,图灵奖得主Yann LeCun称其将为机器人技术带来新时代。该模型能理解物理世界,经训练后在多方面表现优异,Meta还发布新基准测试,也透露了后续计划。
一招缓解LLM偏科!调整训练集组成,“秘方”在此 | 上交大&上海AI Lab等
上海交大和上海AI Lab联合团队提出IDEAL方法,可提升LLM综合性能。研究发现SFT阶段数据数量非关键,配比不当会加剧模型“偏科”。以Llama3.1 8B测试,IDEAL能提升代码能力,还指导了超参数选取。
深夜突袭!谷歌Gemini 2.5 Pro更新蝉联榜一:推理超越o3,编程超越opus4
深夜谷歌对Gemini 2.5 Pro模型重大更新,在编码、推理等测试中超越o3,几周内成稳定版。其价格优势大,还增加思考预算,输出风格和结构改进,用户实测反馈佳,但发布不久被越狱攻击。
LeCun新作反杀AGI派!AI连「鸟」都搞不懂,拿什么超越人类?
图灵奖得主Yann LeCun联手斯坦福团队最新论文揭示,LLM仅在粗糙分类任务表现优秀,精细任务却失灵。研究测试30多个大模型,得出三大发现,指出LLM与人类在概念形成和信息处理上存在本质差异。
小米玄戒O1,五个争议问题与解释
文章围绕小米玄戒O1提出五个争议问题并解释。涉及是否为国产、自研芯片,手机SoC研发难点、小米做SoC原因及玄戒O1是否成功,还结合苹果、高通等案例阐述芯片产业分工等知识。
微软开源浏览器Agent,可实时跟踪、控制智能体,超4000颗星
微软在官网开源用于浏览器网络任务的Agent——Magentic - UI,基于Magentic - One开发,支持人机协同。GAIA测试显示其能提升任务完成率和准确率。它以人为本,有独特机制,框架含多阶段,在Github超4000颗星,支持MIT许可证商用。
红杉中国xbench全球首发,AI智能体真实战力揭榜!
红杉中国推出全新AI基准测试工具xbench及相关论文,采用双轨评估体系和长青评估机制,首期发布两个核心评估集并综合排名,还提出垂类评测方法论。它能追踪模型能力与实际场景价值,解决现有评估难题。
无需训练!让VLM同时具备「视觉」与「推理」能力,数学题得分暴涨30%
当前视觉语言模型(VLM)像‘视力好但数学差的学生’,论文指出问题根源是数据不足和能力分布不均。提出‘模型合并’方案,实验显示在数学基准测试中表现亮眼,还通过实验揭示层间能力分布。
AI教父Hinton警告:有志于编程,不必读大学!
新智元报道,AI教父Hinton等警告AI正在颠覆编程岗位,美国超1/4编程职位已消失。探讨大学是否还应教编程、CS是否值得学,还提及程序员求职难等现状及未来技能需求趋势。
Vibe Coder 之死
文章围绕Vibe Coder之死展开,讲述机器人因Vibe Coding失控视频走红,引发对机器人安全热议,探讨其危害、发生可能性、防范措施等,指出当前AI发展枉顾安全,还提及人们对AI+机器人未来的多种看法。