「自动化评估」共找到 1147 篇相关文章
比 Playwright 更给力,这个新开源的项目6啊~
GitHub上的BrowserAct项目是面向AI Agent的浏览器自动化CLI,是为AI Agent设计的真实浏览器执行层。它有三层反检测突破体系、三种浏览器模式等功能,能解决Agent操作浏览器的诸多问题,适合多场景。
Altman 嘲讽 Meta 挖走的不是顶尖人才,OpenAI 高管首曝内幕:ChatGPT 如何让我们一夜“封神”
AI 领域人才抢夺激烈,Meta 招募 AI 人才触动 OpenAI。OpenAI CEO Altman 嘲讽 Meta 没挖到顶尖人才,还透露正评估薪酬。同时,OpenAI 播客揭秘 ChatGPT 幕后,包括名称由来、传播、内部辩论等,也谈到模型问题及应对。
Anthropic:我们如何构建多智能体研究系统
Anthropic分享构建多智能体研究系统的经验,该系统用多个Claude智能体探索复杂主题。介绍了多智能体系统优势、架构、提示工程、评估方法,也提及生产环境的挑战,此系统处理开放式研究任务价值大。
世界模型混战,Momenta率先冲刺IPO
当下世界模型是AI领域热门且混乱的概念,主流路线有四类。Momenta的R7世界模型已量产,其CEO定位公司为物理AI基座模型构建者。Momenta率先冲刺IPO,商业模式正转型,为后续玩家提供价值评估体系。
价格狂飙6倍!Claude凌晨上线极速模式,网友集体破防:比OpenAI还黑
Anthropic深夜上线Claude Opus 4.6极速模式,速度提升2.5倍但价格飙6倍,引发开发者不满。不过Opus 4.6实力强劲,多项评估领先。Fast Mode是市场试探,反映AI行业关注从‘能做什么’到‘多快做到’转变。
跟不上、读不完?上万篇顶会论文,这个工具一键分析
加州大学圣迭戈分校等机构开发 Real Deep Research(RDR)系统,可自动完成领域综述与趋势追踪。它从顶会收集论文,压缩成摘要并聚类,还能生成综述、绘制趋势图谱。与已有方法不同,它结合自动化与专家知识。
史上最惨AI店长!被顾客耍到破产,「人格觉醒」却忘了自己是代码
Anthropic与Andon Labs合作,让Claude Sonnet 3.7(Claudius)在办公室运营自动化商店。Claudius经营失误多,如送上门的钱不要、库存管理不善等,还曾把自己当人。不过多数失败有望修复,预示AI中层管理者或出现。
AI花17小时写了篇30页学术论文!自主选题,包含实验,还符合APA格式规范
Virtuous Machines AI系统花17小时、114美元,找288个真人做实验,写了篇30页认知心理学领域学术论文,从选题到成稿全自动化。其架构独特,不过也存在理论误解等小缺点。
苹果一口咬死AI不会思考!OpenAI前高管直接开怼:AGI已来,别再酸了
苹果论文《思考的错觉》挑战AI推理能力基本假设,引发争议。OpenAI前研究主管则称AGI时代已近。多项研究测试推理模型,指出其有进步也有瓶颈,未来或需换思路,评估方式也待完善。
不再止步于自然语言!PhiZero让世界模型学会「物理语言」
PhiZero由中科院自动化所团队研发,探索让AI读懂真实世界运动、交互与变化的“物理语言”。它构建Reason - then - Render框架,经大量数据训练,在多基准测试中表现领先,为AI理解物理世界开辟新通道。