「自动化评估工具」共找到 2870 篇相关文章
从 ReAct 到 Ralph Loop:AI Agent 的持续迭代范式
文章围绕AI Agent持续迭代范式展开,指出AI编程助手现存过早退出等问题,介绍了Ralph Loop范式,阐述其核心要素、原理、优势,对比与传统智能体循环差异,还给出使用最佳实践、适用场景与建议。
别再问什么工作被AI取代!Karpathy直指本质:你的工作「可验证」吗?
前特斯拉AI负责人Andrej Karpathy提出,软件1.0自动化能指定的任务,软件2.0自动化能验证的任务。判断任务能否被AI接管,关键看是否满足可重置、可高效试错、可自动奖励三条准则。
超越AlphaFold 3!ProRNA3D搞定RNA蛋白互作,攻克癌症、病毒有了新武器
弗吉尼亚理工Debswapna Bhattacharya团队开源AI工具ProRNA3D - single,能仅靠单条蛋白质和RNA序列预测二者复合物三维结构,超越AlphaFold 3等工具,基于生物语言模型,有诸多应用价值,也有改进方向。
让视觉语言模型像o3一样动手搜索、写代码!Visual ARFT实现多模态智能体能力
上海交大等团队推出多模态智能体训练方法 Visual-ARFT,让视觉语言模型有「工具智能体」能力,还开源项目。它能自动调用工具、拆解任务,团队构建 MAT-Bench 评测,其在多任务超 GPT-4o。
对话寻影:大家都在解决怎么拍得更好,我们想干掉「拍」这件事
这是对睿魔智能(OBSBOT 寻影)创始人刘博的采访。2016 年浙大四人团队创业,让摄像机自动拍摄。公司连续五年 50%以上增长,全球高端 Webcam 市占率第一。刘博分享发展历程、产品逻辑、市场策略等。
“传统设计流程已死”!IDE成Claude设计负责人新宠:Anthropic人人写代码,最不怕Bug
Claude设计负责人Jenny Wen在访谈中表示,AI冲击下传统设计流程已过时,设计师工作重心改变,IDE成新工具。她分享AI工具栈,点明三类有竞争力设计师,还谈及设计管理、产品发布等观点。
斩获22K star!再见重复劳动,微软AI开源智能办公机器人来了!抓紧用起来
微软推出视觉自动化神器`OmniParser`,上线GitHub获22K star。它重新定义人机协作,有三大能力、五大自动化杀手锏,适用于六大实战场景,还给出速成指南,与同类方案相比优势明显,正重塑办公范式。
YC掌门人60天写了60万行代码,一个人干20人的活,他把方法论全开源了
Y Combinator总裁Garry Tan 60天写超60万行代码,将方法论整合成开源工具gstack。它把Claude Code变成虚拟工程团队,含15个角色和6个增强工具,可并行运行多个Sprint,还具备多种实用能力。
上海交大团队发布首篇「搜索智能体」综述!四个维度深度剖析搜索智能体
上海交大团队发布首篇「搜索智能体」综述,从如何搜索、优化、应用、评估四个维度剖析。随着LLM兴起,搜索从传统模式向搜索智能体转变,虽有潜力但缺统一研究视角与评估框架,该综述提供了路线图。
自适应Agent基础模型:从“会推理/会用工具”到“懂得取舍的执行者”
当前大型语言模型在智能体/工具调用场景有推理型和工具型两类,存在效率与功能、深度的矛盾。A²FM框架提出多模式自适应路由,实现模式自适应切换,在多基准测试中效果与效率双升。