能力显著向量」共找到 3756 篇相关文章

算法论文8

首个用户生活「长程模拟器」来了!LifeSim 重新定义大模型个性化评测

现有个性化助手评测基准与真实用户-助手交互脱节,来自复旦大学等的研究人员提出 LifeSim 框架及 LifeSim-Eval 评测方法。实验显示主流 LLM 处理显性需求尚可,隐性意图识别等方面短板明显。

机器之心
7

Github持续上榜,这款 AI 自动渗透项目真有点东西!

传统渗透测试依赖人工,效率不高。开源项目PentAGI将‘AI Agent + 渗透测试’结合,能自动完成渗透测试任务,有自主决策能力,功能特性丰富,安装使用较方便,虽有局限但值得尝试。

开源先锋
产品应用8

Suno、Udio都被它干翻!中国AI音乐模型拿下AA全球榜单双料冠军

昆仑万维旗下 AI 音乐大模型 Mureka V8,在 Artificial Analysis 榜单上登顶 vocals 和 instrumental 双榜第一,超越国际主流模型。实测亮点多,其技术进步显著,V9 也将解决表达偏差问题。

机器之心
算法论文8

CVPR 2026 | 给扩散模型装上「物理引擎」: 北大彭宇新团队提出NS-Diff,使扩散模型学会流体与刚体力学

北大彭宇新团队提出 NS - Diff,将物理约束与强化学习结合,解决视频生成物理失真问题。它通过多模块提升视频物理真实感,实验表明在多数据集上超现有方法,降低物理运动误差。

机器之心
算法论文8

结构化扩展拿下Agent工具检索新SOTA,精准找到API|ICLR'26

宁波东方理工大学沈晓宇团队在ICLR 2026发表论文,指出当前工具检索瓶颈在于工具文档。提出对文档结构化扩展,再训练模型的方案,构建TOOL - REX等组件,实验显示显著提升检索性能。

量子位
算法论文8

马斯克惊叹!DeepSeek和Kimi先后出手,捅破了Transformer的「潜规则」!

文章介绍了DeepSeek和Kimi在残差连接上的突破。DeepSeek让连接权重可学习,用数学约束保证稳定性;Kimi将注意力机制用于层间连接,解决了更根本的问题,性能提升显著

花叔
开源动态8

不会拍照有招了!北大彭宇新团队开源首个美学指导大模型Venus,帮你拍好照|CVPR 2026

北大彭宇新教授团队针对现有大模型在摄影指导上的不足,定义美学指导任务,构建数据集AesGuide,提出美学指导大模型Venus。相关论文被CVPR 2026接收并已开源,Venus在多项评测中优于现有方法。

量子位
新闻资讯7

北约将活蟑螂的神经接入AI,化身无孔不入的赛博格侦察兵

德国SWARM Biotactics公司将电子系统与活体蟑螂结合,打造赛博格侦察兵,可进入传统设备难以到达区域。公司追求以生物繁殖代替工业制造扩展能力,该项目获融资正从实验室走向现场。

新智元
新闻资讯7

Anthropic:警惕评测排行榜!差别可能只是机器的内存更大,而已

Anthropic发工程博客指出,AI编程评测排行榜上排名前列的模型分差小,而运行环境硬件配置能让分数波动6个百分点。同一模型在不同沙箱策略下分数不同,资源配置影响评测结果,排行榜分数差距或因硬件。

AGI Hunt
推荐文章8

从实践到原则:为 AI Agent 构建的 Harness Engineering 落地与探索

生成式 AI 进入软件开发核心流程,但 AI 写代码速度超团队控复杂度能力。问题不在模型,而在软件工程系统。Harness Engineering 试图解决此问题,从三层面重新设计工程系统,已有公司实践。

phodal