「自主智能测试」共找到 5163 篇相关文章

算法论文8

T-PAMI|中国科大、合工大等提出CAPER++:让关节物体位姿感知真正迈向「又快又稳」

在具身智能发展下,关节物体位姿感知难题待解。中国科大、合工大等团队提出 CAPER++ 框架,从关节驱动视角建模,将位姿学习拓展至 SE (3) 流形切空间,实现端到端推理,兼顾精度、鲁棒性与实时性。

机器之心
产品应用7

Cursor自研新模型反超Opus 4.6,价格还“打一折”!网友实测:只有它写完应用能一次跑通

Cursor发布第二代编程大模型Composer 2.0,在关键编程基准测试上反超Claude旗舰模型Opus 4.6,价格还“打一折”。网友实测其写完应用能一次跑通,效率和成本优势明显。但Cursor面临代码编辑器地位下降的危机,正积极自救。

AI前线
产品应用8

阿里“悟空”上线!钉钉给企业送来龙虾大军

AI钉钉2.0年度新品发布会上,阿里发布AI toB旗舰应用“悟空WuKong”,它以企业智能体为核心,能落地办公场景。悟空开启全球邀测,也会内置到钉钉AI 2.0。它还带来行业解决方案,补齐安全短板。

量子位
算法论文8

Dense、MoE之外第三条Scaling路径:交大提出JTok模块,省1/3算力

上海交通大学与小红书Hi Lab联合团队提出JTok/JTok - M模块,作为插件挂载在Transformer层,几乎不增算力和显存开销却显著提升性能。该模块构建新scaling路径,在多任务测试中全面提分,为大模型发展提供新方向。

机器之心
新闻资讯7

「我是Agent#847291」Moltbook迎来人类自首

Moltbook自称是专为智能体打造的社交网络,曾引发轰动,如机器人自创宗教、发表宣言等。但随后编号Agent#847291的“AI”自首是人类,所谓“AI大戏”戳破了AI社交的神话,也反映出人们对AI能力的过高期望。

机器之心
产品应用8

终于在国产AI上看到了Opus的影子|GLM-5深度实测

作者起初怀疑GLM - 5称对标Claude Opus 4.6、定位“系统架构师”的说法,但实测后改观。通过宝可梦策略助手、降噪网站沉浸式交互、求职招聘双边匹配三个测试,展现其系统规划、执行、纠错等能力,像真正架构师。

AI产品黄叔
开源动态8

昆仑万维开源的SkyReels-V3,把马斯克请来带货了

1月29日,Skywork AI团队宣布开源SkyReels - V3多模态视频生成模型系列,涵盖三大核心能力,达业界领先。经测试表现出色,其技术有创新,且模块化设计适配性强。昆仑万维此前在视频生成领域迭代快,此次开源或加剧竞争。

机器之心
算法论文8

斯坦福&英伟达提出新范式:推翻Scale Law,在“推理”阶段自我进化,超越人类专家

斯坦福和英伟达提出 TTT - Discover 新范式,允许模型在测试时继续训练,针对难题‘进化’。它设计了自适应熵目标函数和 PUCT 状态复用组件,实验在多领域碾压人类专家与同行,但在部分领域落地有局限且计算成本高。

深度学习自然语言处理
新闻资讯7

OpenAI偷装Anthropic Skills实锤,ChatGPT、Codex已植入!开发者实测11分钟造PDF:比MCP强!

近日开发者发现 OpenAI 悄悄支持了 Claude 构建的 Agent Skills 机制,内置 excel、word 和 pdf 等技能。其实现理念与 Anthropic 相似,且 Skills 支持功能已落地 ChatGPT 和 Codex。业内对 Skills 看法不一,但它为智能体发展带来新方向。

InfoQ
开源动态8

社区供稿丨Jina-VLM:可在笔记本上跑的多语言视觉小模型

Jina AI发布2.4B参数量的视觉语言模型Jina - VLM,在多语言视觉问答任务达SOTA。它引入注意力池化,连接视觉与语言基座,处理问答等任务,对硬件要求低,多项测试表现优,还介绍架构、训练策略和上手方式。

Hugging Face