PHYX基准测试」共找到 2054 篇相关文章

推荐文章7

【博客转载】CUDA Shared Memory Swizzling

文章讨论用swizzling技术处理CUDA共享内存bank冲突,它可重排索引映射避免冲突且不浪费内存。以矩阵转置为例,对比有冲突、填充、swizzling三种实现,还分析了swizzling和填充优缺点。

GiantPandaLLM
推荐文章8

对谈 DeepSeek-Prover 核心作者辛华剑:Multi Agent 天然适合形式化数学 |Best Minds

文章是对 DeepSeek-Prover 核心作者辛华剑的访谈。他认为强化学习是 AGI 关键解法,Multi Agent 适合形式化数学。还探讨了 DeepSeek Prover 进展、数学与 AGI 关系、评测基准等,指出未来有全才模型和自主 Agent 出现。

海外独角兽
开源动态8

o3绞尽脑汁仅答对40%的题目,开源模型基本乱猜?MMSI-Bench:多图空间智能试金石

文章介绍了MMSI - Bench,这是用于评估MLLM多图像空间推理能力的VQA基准。它人工构建样本、全面分类任务、采用多样真实数据。实验显示MLLM在多图像空间推理有短板,还开发自动化错误分析流程助力改进。

量子位
算法论文8

Knowledge还是Reasoning?具体分析LLM答案正确,不代表思考过程靠谱的问题

斯坦福/加州大学团队指出大模型答案正确不代表思考过程靠谱,传统评估忽略思考路径问题。团队提出双维度评估框架,透视模型思考过程,还测试发现不同领域决胜关键、最佳训练法不同,且框架正解锁新场景。

深度学习自然语言处理
产品应用7

时隔一年,再次使用7个国产AI大模型写高考作文,国产模型的进步也太大了!有彩蛋。

去年评测国产模型写高考作文能力时,各模型问题不少,如用词重复、字数不足。今年再次测试7个国产模型,能力有指数级提升,文采惊人,扣题方面通义千问和文心一言表现出色。文末还有海外模型“翻车”彩蛋。

开源AI项目落地
产品应用7

腾讯 Hy3 一手实测,Agent 能力提升不止一点

作者拿到 Hy3 模型测试资格,介绍其架构、性能和价格优势,还在 WorkBuddy 里实测它完成运营工作、选编辑助教、开发新功能等任务的效果,最后评价 Hy3 能力、价格、适配方面的表现,并分析 WorkBuddy 领先原因。

特工宇宙
新闻资讯7

前后端一起消失:AI Coding正在改写大厂工程师分工

大厂研发组织出现调整,美团前后端团队合并,蚂蚁网商让测试岗转研发岗。AI Coding普及使技术岗位划分重塑,前后端边界成“全栈能力”。AI编程工具虽有后端执行能力,但仍需资深工程师兜底。

InfoQ
产品应用8

Qwen3.7:智能体新前沿

阿里云正式发布面向智能体时代的Qwen3.7-Max模型,将通过API提供服务。它能力全面,编程、办公、长周期执行等表现出色,适配多框架,在多场景评测中领先,能驱动生产力跃升,还经多实战测试验证实力。

千问大模型
算法论文8

Agent-World:扩展真实世界环境,让智能体与环境协同进化!

文章提出Agent-World,将“智能体环境探索”与“自进化训练”结合,构建了1978个环境、19822个工具。实验表明,其在23个基准上一致性优于先进方法与强开源基础模型,还分析了环境规模与自进化对性能的影响。

机器之心
新闻资讯7

跑分第一,推理暴跌!Claude Opus 4.7上线48小时口碑崩了

Claude Opus 4.7发布48小时口碑两极撕裂。官方榜单并列全球第一,但逻辑推理公开测试成绩暴跌,token消耗涨35%,旧接口报错,用户吐槽「更贵、更蠢、更爱顶嘴」,Anthropic虽解释却难平用户怒火。

新智元