看表测试」共找到 2214 篇相关文章

算法论文7

无需训练!让VLM同时具备「视觉」与「推理」能力,数学题得分暴涨30%

当前视觉语言模型(VLM)像‘视力好但数学差的学生’,论文指出问题根源是数据不足和能力分布不均。提出‘模型合并’方案,实验显示在数学基准测试现亮眼,还通过实验揭示层间能力分布。

深度学习自然语言处理
新闻资讯7

AI教父Hinton警告:有志于编程,不必读大学!

新智元报道,AI教父Hinton等警告AI正在颠覆编程岗位,美国超1/4编程职位已消失。探讨大学是否还应教编程、CS是否值得学,还提及程序员求职难等现状及未来技能需求趋势。

新智元
新闻资讯7

Vibe Coder 之死

文章围绕Vibe Coder之死展开,讲述机器人因Vibe Coding失控视频走红,引发对机器人安全热议,探讨其危害、发生可能性、防范措施等,指出当前AI发展枉顾安全,还提及人们对AI+机器人未来的多种法。

AGI Hunt
新闻资讯8

陈大年复出,入局大模型

国产大模型领域黑马StartLux-V1.0-27B-Preview,参数量仅27B,在信通院MCP测试中排综合第二,仅次于1.6万亿参数量的DeepSeek-V4-Pro。其创始人陈大年押注本地模型,公司专注该领域商业化。

量子位
新闻资讯8

李飞飞团队发布新一代世界模型Atlas:从零训练,一次性打通视频生成、 3D重建与机器人仿真

李飞飞创办的 World Labs 发布新一代世界模型 Atlas,称其为‘全球首个多模态世界模型’。它从零训练,能同时完成视频生成、3D 重建和时空模拟,已向少数伙伴开放测试,未来将成 Marble 底层模型。

DeepTech深科技
推荐文章8

复旦硬核青年:破解核材料百年难题,为人造太阳锻造不灭铠甲

张宏亮童年时便渴望稳定电力,考入复旦后历经行业寒冬。他深耕核材料研究,取得多项成果,能用新技术降低成本、能耗,揭示材料新机制,回国后又搭建研究系统、优化工艺等,还重产学研结合和跨界融合。

DeepTech深科技
新闻资讯8

从“卷模型”到“算总账”:AI 产业竞争开始拼什么 | 请回答 WAIC 2026

WAIC 2026热度高涨,InfoQ直播间追问‘AI正在重写什么’。与会嘉宾讨论AI产业新阶段变化,如从‘能力’到‘算总账’,认为模型重要性方式已变,还探讨了AI原生产品定义、AI Infra影响及未来关注方向。

InfoQ
新闻资讯7

3B小模型,编程得分比肩Opus 4.5,神秘模型引发热议,原是国产

最近,3B小模型VibeThinker - 3B在X上火了,它在编程等推理任务上比肩前沿大模型,体积却小很多。它是国产模型,来自新浪微博团队,在各项基准测试现出色,不过在通用知识领域现欠佳。

机器之心
新闻资讯8

谷歌掀桌:深度研究智能体进入自动驾驶时代

4月末谷歌DeepMind推出两款基于Gemini 3.1 Pro的AI研究智能体,标准版重速度,增强版求详尽。Max版在多测试获SOTA得分,能自主研究课题出报告,还可融合数据、生成图,已开启公开预览。

新智元
开源动态8

智谱首秀工程实战经验!Coding Agent日均数亿次调用,GLM-5把长上下文推理的底层问题全逼出来了

今年 2 月智谱 GLM Coding Plan 上线后很受欢迎,随着用户和调用量上涨,Coding Agent 成压力测试场。4 月 30 日智谱发布博客,披露 GLM - 5 系列模型在超大规模 Coding Agent 调用场景下的底层推理技术突破及工程实践经验。

InfoQ