人在循环中」共找到 8796 篇相关文章

算法论文8

230个大模型婴幼儿认知题上集体翻车!揭秘多模态大模型的核心知识缺陷

ICML 2025研究揭示多模态大模型基础认知能力上表现不佳。研究者建测评题库CoreCognition测试230个主流模型,发现其存核心知识缺陷,扩规模难补短板,还需补齐核心知识。

量子位
产品应用8

海外华15团队打造,统一理解与生成的图像模型,超越Nano banana登顶图像编辑

海外AI初创公司Luma发布图像生成模型Uni-1,将「理解」与「生成」统一,多任务测试中表现优于GPT Image 1.5和Google Nano Banana Pro。它采用独特架构,提升理解能力,由华团队打造。

机器之心
算法论文8

33%!Claude、GPT、Gemini 真实网站上集体翻车,ClawBench 把 AI agent 打回原形

ClawBench让AI144个真实网站执行153个日常任务,结果惨烈,如Claude Sonnet 4.6每三任务翻车两个,GPT - 5.4仅完成10个。它还揭示AI真实环境的问题,为评估模型提供标尺。

机器之心
算法论文8

太巅了!MIT老哥Transformer里造了台计算机,LLM从此不需要调用外部工具?

LLM数学推理表现佳,但纯计算是短板。MIT的Christos Tzamos团队Transformer内造计算机,实现WebAssembly解释器,解决数独难题,还突破注意力机制瓶颈,打开软件与神经网络新接口。

AI寒武纪
算法论文8

Anthropic Claude 内部发现"全局工作空间",可以直接读取模型没说出口的想法

Anthropic发布研究,Claude内部发现J - space(雅可比空间),即“全局工作空间”,它训练中自发形成。用雅可比透镜技术可读取其内容,还验证了其功能属性,可用于对齐审计等。

AI工程化
新闻资讯8

Anthropic重磅新研究:当AI采访了1250,它看见了类的「职业软肋」

Anthropic推出Interviewer工具,与1250名职场、创作者、科学家深度对话,记录细节并量化。该工具能自动完成访谈、分析等流程,受访者满意度超97%。研究揭示不同职业对AI态度受职业结构等因素影响。

新智元
新闻资讯7

具身智能学界业界思想「惊的统一」?美团IROS开了个学术年会

美团IROS举办学术年会,展示了具身智能与零售服务结合方面的愿景与成果,如无机配送初具规模。多位学界和业界大咖参会并发表见解,对具身智能发展方向观点惊统一。

机器之心
新闻资讯7

Karpathy盛赞DeepSeek-OCR“淘汰”tokenizer!实测如何用Claude Code 让新模型跑N卡上

DeepSeek发布新模型DeepSeek - OCR,实用场景达SOTA且token消耗最少。Karpathy赞其或淘汰tokenizer,Pleiasfr联合创始称是里程碑。开发者Simon用Claude Code让模型NVIDIA Spark上跑通。

InfoQ
算法论文8

700万参数击败DeepSeek R1等,三星一独作爆火,用递归颠覆大模型推理

今年6月Sapient Intelligence提出的HRM影响大模型推理结构,四个月后三星研究员Alexia Jolicoeur - Martineau推出TRM,700万参数模型推理基准测试中超越参数多10000倍的模型,还介绍了TRM原理、改进及实验结果。

机器之心
开源动态8

5.8K Star爆火!!终端里开网页、刷视频、玩游戏,这操作真绝了!

介绍开源工具`term.everything`,它能终端运行任何GUI应用,像浏览器、游戏等。该项目GitHub获5.8K star,支持X11和Wayland应用,可远程使用,但画质和性能有局限。

开源先锋