「图灵-AGI测试」共找到 2187 篇相关文章
230个大模型在婴幼儿认知题上集体翻车!揭秘多模态大模型的核心知识缺陷
ICML 2025研究揭示多模态大模型在基础认知能力上表现不佳。研究者建测评题库CoreCognition测试230个主流模型,发现其存在核心知识缺陷,扩规模难补短板,还需补齐核心知识。
奥特曼:感受不到GPT-5变强,是因为你还不够「专业」
GPT-5发布后口碑不佳,直播事故、网友吐槽、专家唱衰不断,有人喊出‘AI第二次寒冬要来了’。但奥特曼认为这是节奏和期待错位,GPT-5在科研等高阶领域有提升,技术范式也有转变,且OpenAI仍看重规模。
代码生成要变天了?被质疑架空后,Yann LeCun携320亿参数开源世界模型“杀回来了”
美国当地时间9月24日,Yann LeCun团队发布320亿参数代码世界模型CWM。它创新训练方式,能模拟代码执行。性能测试表现出色,还开放检查点。Meta AI业务重组,CWM发布或表明未彻底放弃开源。
AIME'25满分炸场!Qwen一波七连发,全家桶大更新
云栖大会上,通义团队成果丰硕。Qwen3-Max性能提升,数学评测满分,多测试成绩优异;Qwen3-VL、Qwen3-Omni等开源,各有亮点;Qwen3-Coder升级。吴泳铭称要发展超级人工智能。
无需训练,即插即用:西湖大学发布世界模型WorldForge,让普通视频模型秒变「世界引擎」
自Sora亮相,AI视频可控性成瓶颈。西湖大学AGI实验室团队提出WorldForge框架,在推理时为视频模型注入「时空几何」,无需训练,实现单图360°环绕视频生成和视频重运镜等,降低创作门槛。
阿里开源DeepResearch模型,超强“AI研究员”,开启自主智能体新纪元
阿里巴巴通义实验室开源Tongyi DeepResearch模型,是全球首个性能能与OpenAI DeepResearch较量且全开源的Web Agent。它采用先进架构,有两套推理范式,训练方法论有创新,实测表现佳,应用场景广,用Apache - 2.0许可证。
三大核心创新公开,快手开源多模态Keye-VL 1.5拿下视频理解SOTA,8B力压GPT-4o!
快手开源多模态Keye-VL 1.5,为8B视频理解大模型,公开3大核心创新技术。靠Slow - Fast视频编码等,在20 + 基准屠榜。它能精确视频定位,实验显示通用、视频理解和数学推理表现佳。
陶哲轩都惊了!o3首战「AI奥数」碾压夺冠,开源军团仅差5分狂追OpenAI
AI界奥数杯重启,OpenAI o3首参赛,算力拉满时以47分夺冠。测评显示在奥数数学推理上,商用和开源AI差距缩小,开源即将追上商用模型。报告完整测试结果已放出。
Google Nano Banana 与 GPT-4o Image 1:哪款 AI 图像生成更好?
2025年8月26日,Nano Banana发布引关注,而GPT - 4o Image 1是主流常用图像生成器。文章从关键指标、生成速度对比二者,又用相同提示词在多种场景对比,分析各有优劣,适用场景不同。
推理能力再突破!蚂蚁 | 提出Agentic Deep Research新范式,可信度同步增加
尽管LLM能力提升,但复杂任务表现受静态知识限制。业界提出Agentic Deep Research系统,现存系统训练有梯度冲突和奖励稀疏问题。蚂蚁团队提出Atom - Searcher,创新推理范式,构建细粒度奖励,结合奖励训练,实验效果佳。