无门控测试」共找到 2292 篇相关文章

产品应用7

GLM4.5实测:审美不如R1,全栈还不大可用,别急冲

7月29日智谱开源GLM - 4.5。作者实测发现其在UI设计审美不如R1,生成卡片表现不一,Coding能力勉强及格,全栈代码生成未达可用阈值,存在多模态能力、上下文窗口短等问题,目前还别急着冲。

AI产品黄叔
算法论文7

现代GPU体系结构Cache Operators行为研究

本文基于Compute Capability 8.9的L20 GPU进行实验,对NVIDIA PTX Cache Operators行为做进一步探究,验证了STG指令命中L1 Cache时执行Write Through等结论,还提出了遗留问题待解决。

GiantPandaLLM
开源动态8

百度开源文心4.5系列10款模型,多项评测结果超DeepSeek-V3

今日百度正式开源文心大模型4.5系列10款模型,涵盖不同参数规模。该系列模型在多文本和多模态基准测试达SOTA,多项评测超Qwen3、DeepSeek - V3,还具备三大关键创新,获开发者关注。

Founder Park
7

苹果一口咬死AI不会思考!OpenAI前高管直接开怼:AGI已来,别再酸了

苹果论文《思考的错觉》挑战AI推理能力基本假设,引发争议。OpenAI前研究主管则称AGI时代已近。多项研究测试推理模型,指出其有进步也有瓶颈,未来或需换思路,评估方式也待完善。

新智元
新闻资讯7

北大卢宗青:现阶段世界模型和 VLA 都不触及本质|具身先锋十人谈

北大卢宗青作为具身大脑创业者,认为现阶段世界模型和 VLA 未触及本质。他指出互联网视频数据是唯一可规模化的道路,其创立的「智在界」正标注互联网视频中人类关节动作让模型学习。

AI科技评论
开源动态8

Qwen3新成员:Embedding系列模型登场!

今天正式发布Qwen3-Embedding系列模型,专为文本表征等任务设计,继承Qwen3多语言理解优势。在多项基准测试表现卓越,已在多平台开源,有卓越泛化性、灵活架构与多语言支持等特点。

通义千问Qwen
新闻资讯7

大模型的新战场在推理?——《推理模型综合测评报告 2025》深度解析 | 直播预告

5月29日,InfoQ研究中心发布《推理模型综合测评报告2025》,通过五大维度、五大题型的300道测试题对八家主流推理模型全面测评,还总结各维度表现,梳理技术前置因素与趋势。6月6日有直播解读。

InfoQ
新闻资讯7

00后中国女孩0产品创业实现3亿估值:斯坦福数学博士的AI量化野心

00后中国女孩洪乐潼创业一鸣惊人,虽产品和用户,但目标估值3 - 5亿美元。她是斯坦福华人数学博士,公司Axiom想为量化和对冲基金公司提供解决数学问题的模型能力,获投资人关注。

量子位
算法论文7

模型宣称的“百万字处理能力”是真本事,还是营销噱头?LongCodeBench揭露真相

近年来大模型号称有百万字处理能力,但这是真本事还是噱头存疑。论文用LongCodeBench测评工具揭开长上下文模型真实表现,测试顶尖模型发现长文本能力‘翻车’,还分析了长上下文难的原因及面临的瓶颈。

深度学习自然语言处理
新闻资讯7

Anthropic将在两周内推出新思考模型!

据The Information报道,Anthropic将在未来几周推出Claude Sonnet和Claude Opus两款新模型,能在「思考」和「工具使用」间切换,还可自动测试纠正代码。虽此前产品有不足,但新模型处理复杂任务更出色。

AGI Hunt