「任务执行能力」共找到 4859 篇相关文章
机械手真正「活」了,银河通用&清华推出DexNDM,用神经动力学重塑灵巧操作
银河通用与清华推出DexNDM,旨在解决灵巧操作技能sim - to - real难题。它能让灵巧手掌握多种转轴、多样手腕朝向下旋转物体的技能,构建的半自主遥操系统可完成复杂工具操作和长程装配任务,在sim - to - real方法上有创新。
端到端语音模型:从语音表征到模型架构
本文整理自阶跃星辰语音模型负责人杨学锐在2025年QCon全球软件开发大会的分享。介绍大模型对语音技术的重塑,涵盖识别、合成等方面;阐述端到端语音模型构建,涉及表征、架构、训推和任务;还提及模型评估方法。
AI能否独立开展科研?ASI-Bench为科学自主性建立评测标尺
ASI-Bench是衡量AI系统科学自主性的基准测试,由多机构联合开发。它能测试AI通用智能、创新性和执行力,通过信息梯度设计,让模型在不同指导量下完成科研任务,结果显示当前AI离自主科研有明显距离。
大模型之外,向量存储如何支撑 Agent 的检索链路
文章指出大模型负责理解、推理和生成,而Agent需获取外部数据等。向量存储可将数据转化为语义向量,在Agent执行任务时找回相关内容。文章探讨向量存储技术方向,分享做法,还演示阿里云两种Serverless向量存储用法。
ICLR 2026 | ProSafePrune:一剪见效,告别大模型过度防御
合肥工业大学与科大讯飞联合团队提出全新低秩参数修剪框架 ProSafePrune,被 ICLR 2026 录用。它能精准定位模型认知偏差并修剪,降低过度拒绝率,不损安全防御能力,还提升通用任务性能,为 LLM 安全部署提供新思路。
Qoder @database功能上线!自动关联数据库 Schema,后端 AI Coding 效率拉满
Qoder JetBrains插件上线@database功能,将数据库能力内置为核心上下文,可一键让AI结合真实业务表结构处理SQL编写等任务。它是JetBrains上唯一深度支持“数据库原生感知”的AI Coding插件,还介绍了使用方法、场景及注意事项。
DeepSeek正开发高级AI Agent模型,硬刚OpenAI
彭博消息,DeepSeek正开发高级AI Agent模型与OpenAI竞争。此模型能在极少指令下执行多步任务并自我优化,计划Q4推出。此前该司模型表现佳,技术已在多领域落地,但构建AI Agent仍有挑战。
AI哪怕答案正确,逻辑链却惨不忍睹,奥数级不等式证明成功率不到50%| 斯坦福&伯克利&MIT
斯坦福、伯克利、MIT等联合研究,系统评估29个大模型在奥数级不等式证明任务的能力。研究发现,模型答案正确多靠猜,推理漏洞多,参数大、思考久也不能提升推理严谨度,但自我反思和定理线索策略有改善效果。
Gemini 3.5 Pro绝密泄露,前端赶超Fable 5!
全网被Gemini 3.5 Pro泄露刷屏,传闻7月17日发布。它在前端生成表现出色,一次成型、精准零失误,性能超Fable 5,但在硬核推理等任务上不如Fable 5和GPT - 5.6。谷歌为其重预训练,还准备对标GPT - Image 2的图像模型。
0.3B参数,600MB内存!腾讯混元实现产业级2Bit量化,端侧模型小如手机App
腾讯混元团队推出面向消费级硬件的“极小”模型HY-1.8B-2Bit,参数量仅0.3B,内存占用600MB。它基于产业级2Bit端侧量化方案,生成速度提升,还通过多种方法提升能力,未来将探索新技术缩小与全精度模型差距。