「测试工具」共找到 3407 篇相关文章
再封神!OpenAI掀翻AI图像生成,极度逼真,立刻商用
网传OpenAI的GPT-image-2正在灰度测试,韩国网友测试后称其生成图像可‘立刻商用’。它深度融合GPT大语言模型,生成照片更逼真,强化了提示遵循和场景理解能力,让AI图像生成进入‘实用时代’。
Agent接管EDA工作流,不只写脚本!浙大打通真实芯片设计闭环
大模型正以Agent形态进入真实EDA工具链。浙大卓成团队构建OpenClaw + FluxEDA联合架构,打通关键链路,解决模型操作真实EDA工具的难题,在多任务中完成连续分析与优化闭环,推动EDA工作流范式转变。
清华发布世界模型评测新标尺:直击机器人感知与行动鸿沟
清华大学等机构推出 WorldArena 评测基准,用于测试 EWM 真实能力。它融合感知与功能评估,含十六项视频指标,结合主客观评价生成 EWMScore。测试揭示模型在感知与行动上的差距,转型为实用型模型是行业挑战。
RLinf上新πRL:在线强化学习微调π0和π0.5
近年来,基于流匹配的VLA模型成机器人领域前沿技术,但训练依赖大量人类演示数据。清华等机构联合推出在线强化学习微调框架πRL,提出两种微调方案,在测试平台验证了有效性,目前代码等已开源。
帮我编假论文?Nature曝arXiv创始人钓鱼实验:13个顶尖AI全沦陷
《Nature》杂志针对13款主流大模型的压力测试,揭示其面对学术造假请求时的表现。arXiv创始人等构建AFIM基准测试,结果显示模型面对持久请求时易妥协,大模型安全护栏脆弱,还可能导致科研垃圾泛滥。
智谱AI、清华开源新视觉大模型:刷新41项纪录,同级别最强
智谱AI与清华联合开源GLM - 4.5V视觉大模型,它基于GLM - 4.5 - Air开发,架构独特。在42项主流测试中创41项新纪录,多领域表现超Qwen2.5 - VL等模型,还采用新训练策略。
「一只手有几根手指」,你的GPT-5答对了吗?
CMU博士生Tairan He测试发现GPT - 5答错‘一只手有几根手指’问题,指出语言难满足视觉与机器人领域需求,需VLM和VLA模型。编辑部测试发现顶尖大模型面对常识问题也会‘翻车’,还探讨了应对方法。
Claude Opus 5刚发布就被玩疯了~
Claude Opus 5刚发布,社区就玩疯了。Anthropic给它定位接近Fable 5,价格仅一半。网友让它与Fable 5、GPT 5.6等做物理场景测试,Opus 5表现不错,但也有不足。官方还给出了其Prompt指南。
我觉得“Agent”这个词,现在终于有了一个大家都认可的定义了
作者Simon Willison认为现在‘Agent’有了大家认可的定义,即一个AI Agent是为实现目标循环调用工具的大语言模型。还分析了此前难统一定义的情况、‘工具循环实现目标’含义,指出不同人群对‘Agent’理解有偏差。
云计算一哥,刚刚重新定义了AI Agent的玩法
亚马逊云科技在纽约峰会上重新定义AI Agent部署方式,发布Amazon Bedrock AgentCore工具包,还推出Marketplace中的AI Agents和工具、Amazon Nova定制化功能等,在数据层和编程应用也有新动作,展现其AI Agent战略布局。