感知级评估」共找到 1884 篇相关文章

算法论文8

世界首个!李飞飞团队推出物理推理基准,大模型统统不及格?

斯坦福联合中科大团队推出世界首个评估视觉语言模型物理推理能力的基准QuantiPhy,通过测试发现顶尖模型在数值计算上不如人类,还揭示模型推理靠记忆而非测量,为AI发展指明方向。

AIGC开放社区
产品应用8

当 GPU 成为主角:解锁 AI 集群中那 85% 的闲置 CPU 算力

全球AI算力规模增长,GPU成主角,但GPU满负荷运转时CPU利用率低,传统调度机制无法保障优先,造成资源浪费。TencentOS如意(RUE)的在离线混部技术改造Linux内核调度体系,高效释放算力。

InfoQ
新闻资讯7

都快2026年了,机械硬盘居然涨价了

消费电子市场未获AI利润,先遭冲击。因AI基建对存储需求大,内存、闪存颗粒及机械硬盘纷纷涨价。机械硬盘出货量十年来首增,价格回升,厂商借此控产保利润,消费产品也受影响。

远川科技评论
开源动态8

【GitHub 10.9k star】DeepCode:把论文和需求文档“一键变代码”的多智能体开发神器,真能干掉手写样板?

DeepCode 是香港大学开源的多智能体开发平台,支持将论文、需求文档等转化为生产代码。它能解决论文复现、原型开发等痛点,有多项特色功能,在性能对比中领先,适用于多类场景。

小华同学ai
产品应用8

Claude Opus 4.5 × Agent Skills:从第一性原理深入剖析

文章深入剖析Claude Opus 4.5与Agent Skills,介绍了Claude Opus 4.5发布,结合Agent Skills能让模型有专业能力。还阐述Agent Skills高设计模式、内部架构及执行生命周期,揭示其工作机制与优势。

PaperAgent
7

硅谷10万大裁员真相:AI根本没想取代你,是老板想干掉你

美国科技公司正大规模裁员,10月裁员人数暴涨。出版业大亨认为AI或致全民失业或经济崩盘,Meta用AI辅助绩效评估。AI常成裁员借口,实则与盲目扩招、财务压力等有关,美国大学文凭也在贬值。

新智元
产品应用7

理解规范驱动开发:Kiro、spec-kit和Tessl

作者尝试理解规范驱动开发(SDD),查看了 Kiro、spec - kit 和 Tessl 三个自称 SDD 的工具。介绍了 SDD 定义、规范含义,分析评估工具的挑战,还指出工具存在不适合多数编程问题、审查体验差等问题。

InfoQ
算法论文7

大模型在具身推理上「翻车」了?4496 道题全面揭示短板

美国东北大学等提出BEAR基准评估MLLM具身智能子能力,用4496道题测试20个模型。发现多模态大模型具身能力不足,还分析错因,开发BEAR - Agent提升模型具身推理能力,在仿真测试中效果显著。

机器之心
算法论文7

VaseVQA:考古领域实现专家,诊断+补弱RL框架

在文化遗产与人工智能交叉领域,研究人员提出把大型多模态模型放于‘诊断—补弱—精细化评估’闭环训练,配套结构化评测基准,让模型在文化遗产领域接近专家能力。介绍了技术步骤、数据基准及关键发现等。

新智元
算法论文8

ACL 2025 | GALLa:给代码大模型装上“透视眼”,看懂程序的“骨架”!

蚂蚁集团与上海交大合作的 GALLa 研究被 ACL 2025 主会录用。它利用图神经网络将代码图结构信息注入大模型,在 7 个模型和 5 个任务上提升性能,推理与普通 LLM 一致,不增成本。

PaperAgent