智能体任务」共找到 4937 篇相关文章

开源动态8

企业级OpenClaw最强拍档来了!万亿参数的国产多模态大模型,刚刚开源发布

YuanLab.ai团队开源源Yuan3.0 Ultra多模态基础大模型,是万亿级开源多模态大模型之一。它优化训练效率,在多任务表现突出,为企业Agent AI提供支撑,还提出新算法和训练策略,全面开源推动落地。

量子位
开源动态7

AI用3年时光,来了解你!首个AI Clone长期记忆基准

现有AI记忆评测存在数据源单一、忽视变化本质、注入成本高等局限。开源学术社区QuantaAlpha联合高校团队提出CloneMem基准测试,构建合成人生,设计评测任务,实验发现简单方法在检索上更有效,记忆系统应还原信息。

新智元
新闻资讯7

奥特曼和量子计算奠基人讨论GPT-8

奥特曼在节目中与量子计算奠基人戴维・多伊奇就AI能否发展成有意识的超级智能产生分歧。奥特曼搬出GPT - 8举例试图说服对方,引发网友对AGI定义标准的讨论。

量子位
新闻资讯8

内幕曝光:OpenAI模型坦承不会第六题,3人俩月拿下IMO金牌!

OpenAI三人团队俩月让AI达IMO金牌水平。他们用多智能系统技术,使模型能短时间解复杂问题。新模型有自省能力,减少“幻觉”问题。此次突破是通用推理技术进步,未来将整合进更多模型。

新智元
算法论文7

无需外部数据!AI自问自答实现推理能力进化

卡内基梅隆大学团队提出SQLM框架,这是无需外部数据的自我提问模型,含提问者和解答者角色。通过强化学习最大化期望奖励,设计自监督奖励函数。实验显示其能提升Qwen2.5 - 3B - Instruct多任务准确率。

量子位
新闻资讯8

Cursor终结者?Grok 4正式登顶!马斯克扬言编程碾压,20万N卡年赚47亿美金!

时隔5个月,xAI发布通用模型Grok 4,后续还将推编码、多模态代理和视频生成模型。Grok 4已上线,有三个订阅版本。马斯克称其智能超博士生,在多基准测试中领先,编码或超Cursor。

InfoQ
产品应用7

R2没来,却等来综合性能更优的DeepSeek R1T2

抱抱脸热门排行榜出现R1变模型DeepSeek-TNG-R1T2,构建于多个父模型之上,在智能与输出token长度间达新平衡点,速度快且测试表现佳,还给出与不同模型对比的选择建议。

PaperAgent
新闻资讯7

RoboChallenge发布年度报告:评测标尺够权威吗?

当下具身智能行业存在缺乏真实场景验证、评测标准模糊等问题。2025年原力灵机与Hugging Face推出RoboChallenge评测平台,2026年1月更新榜单。AI科技评论从技术和核心设计角度对其进行深度拆解。

AI科技评论
推荐文章8

刚刚,Cursor又分享了数百Agent并发协作的最佳实践

Cursor分享数百Agent并发协作最佳实践,讲述单个Agent局限,介绍从多方面探索协同方法,如规划者与执行者分工,还展示多个实验成果,总结模型选择等经验,指出多智能协同仍待优化。

PaperAgent
算法论文8

两个LLM互相对线,推理能力起飞:康奈尔团队发布大模型版类GAN训练法

康奈尔大学团队提出面向大语言模型的类GAN训练框架PasoDoble,通过对抗训练两模型提升推理能力,不依赖外部监督,在多模型实验中显著提升数学基准表现,不过在部分领域外任务有局限。

机器之心