推理能力提升」共找到 6167 篇相关文章

开源动态7

解放双手!开源 AI 桌面智能体

桌面智能体Bytebot是拥有专属计算机的人工智能,有完整虚拟桌面。它能使用任意应用、处理文档等。赋予AI独立计算机可解锁新能力,项目地址为https://github.com/bytebot-ai/bytebot。

GitHubStore
产品应用8

你的 Harness 工作流真的在进步吗?我们用一场考试撕掉了遮羞布

文章指出Harness工作流常靠‘主观vibes’驱动,缺乏有效评价体系。为此推出Harness Eval评测系统,包含出题、答题、改卷等环节,形成闭环,帮助工作流持续改进,还能提升整体通过率。

腾讯技术工程
推荐文章7

给AI全局记忆

作者认同OpenAI‘全局记忆’观点,称其能提升对话连贯性,实现AI成个人助理愿景。介绍OpenMemory项目可存储调用记忆,还提及实现功能的三点做法,看好创业者在该领域机会。

newtype AI
产品应用7

OpenAI浏览器换壳杀回!高管改用ChatGPT上网,效率从未这么高

Atlas关停不到一个月换壳回归,核心高管Tibo称ChatGPT桌面版成主力浏览器,效率极高。这源于OpenAI把浏览能力融入ChatGPT。它不再执着造独立浏览器,而是围着Chrome,争用户数字身份。

新智元
算法论文8

刷榜只是体力活!清华消费10万块,一周「肝」出105个SOTA

AutoSOTA通过多智能体协作,将AI研究中繁琐的性能优化过程自动化,使科研从「手工艺」转向「工业流水线」。在一周压力测试中,消耗约10.4万美元,发现105个SOTA模型,平均性能提升近10%。

新智元
算法论文8

对话 Synergy 团队:「龙虾」之后,下一代智能体正演变为「互联网公民」

两年间,AI Agent能力与数量爆炸。Synergy团队认为,下一代智能体应是“智能体公民”,需跨过建立身份、学会协作、实现进化三道门,还探讨了其对互联网的影响及人机共处问题。

AI科技评论
开源动态7

走出 MMLU 的高分幻觉:AI Agent 的「斯坦利时刻」与职场生存法则

文章指出多模态大模型在基准测试分数高,在实际业务流程却像‘职场巨婴’。研究团队构建Trainee - Bench测试顶尖模型,结果显示模型离‘独立上岗’远,凸显提升Agent自主学习性的重要性。

AI科技评论
产品应用8

Claude 4破解困扰人类4年系统bug,30年码龄程序员200小时没搞定,GPT-4.1/Gemini-2.5也做不到

30年码龄程序员4年没搞定的顽固型‘白鲸bug’,Claude Opus 4配合Code模式,用30个prompt+1次重启,几小时就破解。此前GPT - 4.1等模型都失败,凸显Claude编程与推理能力强。

量子位
推荐文章7

Anthropic:现在学习FDE,年薪百万!

Anthropic大佬分享FDE岗位价值,指出其非外包,是面向客户的软件工程师。还阐述适合的人才、团队,纠正三大误区,强调客户买的是解决问题的过程,现场沟通能力正升值。

探索AGI
新闻资讯8

Karpathy 最新访谈:Vibe Coding 只是开始,真正重要的是 Agentic Engineering

Andrej Karpathy在访谈中分享编程范式剧变感受,谈到Software 3.0实质,指出AI能力不均,介绍Vibe Coding和Agentic Engineering区别,还提及创业机会、人类技能价值等内容。

宝玉AI