「实验评测」共找到 1863 篇相关文章
首个OpenClaw智能体宿主机性能评测报告:单机可稳定运行96路Agent实例
OpenClaw成中小企业AI利器,但企业部署面临效率、并发和安全问题。浪潮信息基于元脑x86服务器完成测试,发布评测报告,该服务器单机可稳定运行96路Agent实例,还支持一键配置、多用户隔离。
【CIKM'2026】CQ-SID:LLM生成式检索在手猫搜索召回中的探索与应用
文章围绕LLM生成式检索在手猫搜索召回的应用展开。先点明当前搜索召回机制问题及生成式检索挑战,提出CQ - SID等方法,经实验验证其效果佳,还介绍了线上实验成果,最后展望未来探索方向。
AI花17小时写了篇30页学术论文!自主选题,包含实验,还符合APA格式规范
Virtuous Machines AI系统花17小时、114美元,找288个真人做实验,写了篇30页认知心理学领域学术论文,从选题到成稿全自动化。其架构独特,不过也存在理论误解等小缺点。
「世界理解」维度看AI视频生成:Veo3和Sora2水平如何?新基准来了
近年来,T2V模型进展显著,Sora2爆火引发对其是否为‘世界模型’的探讨。传统基准无法系统衡量模型对事件因果等的理解,中山大学等团队提出新评测框架VideoVerse,评测主流模型并发现开源与闭源模型差距及各模型缺陷。
南大团队直击大模型高分神话:人类90分,最强模型仅49分
南京大学傅朝友团队在Google Gemini评测团队邀约下推出视频理解新基准Video - MME - v2。它有创新的分层能力体系与组级非线性评分,经超3300人工时标注。评测显示模型与人类差距大,还揭示传统Acc指标虚高、‘Thinking’并非总增益等现象。
0行人类代码!OpenAI内部绝密实验曝光:3人团队5个月砸出百万行级产品
OpenAI工程团队进行内部实验,构建并发布零人类代码的内部软件产品,代码全由Codex智能体编写。团队分享开发经验,如重新定义工程师角色、让应用对智能体可见等,还面临一些未知挑战。
卡帕西630行代码炸出81个智能体,4天协作跑2333次实验,公布预训练十大发现
Karpathy的Autoresearch项目630行代码让AI自主实验,提升语言模型训练效率。全球开发者让多智能体协作,智能体自发形成同行评审制度。项目发起者公布十大发现,还衍生出表现出色的auto - discovery项目。
想入局VLA却不知从何下手?NTU&中大开源「终极菜谱」:从基座到频域建模,每一步都有实验支撑
MMLab@NTU联合中山大学的研究推出VLANeXt,从12个关键维度剖析VLA设计空间,每步有实验支撑。它在LIBERO及LIBERO - plus上超越SOTA方法,遇扰动成功率跃升10%,适合不同水平从业者。
普林斯顿发现RLHF显著加剧了LLM胡扯!
普林斯顿研究提出‘机器胡扯’概念,构建分析框架,含胡扯指数、行为分类法和评测集。实验揭示RLHF加剧胡扯,政治语境模型爱‘打太极’,为构建诚实AI提供工具和理论。
MetaGPT 用户智能体发布,开启端到端自主软件测试新范式!
当前AI软件领域代码生成智能化发展快,但测试验收仍靠手动,效率低。MetaGPT推出用户智能体,研究团队发布RealDevWorld框架和AppEvalPilot实现端到端自动化评测,解决复杂软件质量评估难题。