复杂推理能力」共找到 5117 篇相关文章

产品应用8

5小时通关《原神》主线!Lumine:AI玩家正式登场

Lumine能像人类一样理解游戏画面、推理并操作,以接近人类效率5小时通关《原神》蒙德主线,还能零训练玩《鸣潮》等。它是开放式研发方案,靠少量数据和显卡让模型成强大智能体。

带你学AI
开源动态7

我MiniMax,用实习生处理数据,照样屠榜开源大模型

MiniMax M2屠榜开源大模型,引发社区热议。它在注意力机制、数据处理、思考模式上另辟蹊径,公开技术细节。M2团队选Full Attention,雇实习生处理数据,提出交错式思维链策略,强调实用性和泛化能力

量子位
新闻资讯7

薛定谔亲外孙创业量子计算,老黄早早就成了股东

PsiQuantum由薛定谔外孙参与创办,获10亿美元巨额融资,欲2028年造百万比特级量子计算机。其量子比特基于光子,有生产优势,不过纠错能力待验证。公司团队学术背景强,项目多为政府大单。

量子位
算法论文8

突破后训练瓶颈?Meta超级智能实验室又一力作:CaT解决RL监督难题

AI后训练依赖监督微调或程序化检查器,但很多有价值任务缺这两种资源。Meta超级智能实验室等机构研究者提出CaT方法,把推理时额外计算当教师信号,为大模型提供监督,实验显示效果显著。

机器之心
新闻资讯7

2025年了,AI还看不懂时钟!90%人都能答对,顶尖AI全军覆没

AI基准ClockBench测试AI读模拟时钟能力,人类平均准确率89.1%,11个主流大模型最好仅13.3%。研究展示了LLM局限性,分析了可能原因,还对比了不同模型表现及在各类问题上的差异。

新智元
新闻资讯7

Sam Altman宣告软件开发即将进入"快时尚时代"!机遇还是危机

Sam Altman宣告SaaS将进入快时尚时代,新的GPT - 5编程能力或让开发SaaS像Zara出新款般轻松。但此概念最早由Patricio提出,他认为AI编程会带来‘代码污染’,与Sam态度不同。

AI工程化
开源动态8

开源Agent新标杆:通义WebSailor多榜夺魁,挑战OpenAI高难度Agent基准BrowseComp

信息爆炸时代,传统搜索引擎难满足需求,开源Web Agent在极端复杂任务表现不佳。阿里巴巴通义实验室推出WebSailor,通过创新数据构造和训练方法,在BrowseComp等挑战上取得突破,缩小与顶级封闭系统差距。

机器之心
推荐文章8

0day漏洞量产?AI Agent“生产线”曝光

本文探讨AI Agent如何通过多智能体协作系统打造0day漏洞“生产线”,实现自动化漏洞检测。经测试和实战验证,Agent在复杂代码和大型项目中表现超传统工具,提升了漏洞识别效率与准确性。

腾讯技术工程
产品应用7

长程执行成具身智能必考题,墨奇的答案是Agentic-Native|甲子光年

具身智能中长程执行成关键问题,墨奇智能发布具身模型架构MoRA,提出Agentic - Native技术路线,让Agentic能力原生存在于策略模型中,还介绍了模型内部设计、所需数据等内容。

甲子光年
推荐文章7

传统PM假设已死!Anthropic的产品经理是怎么工作的?

文章指出在AI指数级增长时代,传统产品管理假设已不适用。以Anthropic的Claude Code为例,展示模型能力大幅提升,介绍了新的产品管理工作流程、四个根本性转变及新节奏,强调判断力的重要性。

AI工程化