「知识评估」共找到 1171 篇相关文章
对话「哈萨比斯传」作者:“他不喜欢奥特曼”
《哈萨比斯:谷歌AI之脑》作者塞巴斯蒂安·马拉比与量子位深度对谈,探讨书中细节与幕后故事。哈萨比斯不喜欢奥特曼,追求知识科学,与奥特曼价值观不同,书中也谈及他成长、错误及面临的困境。
密室逃脱成AI新考场,通关率不足50%,暴露空间推理短板丨清华ICCV25
清华大学团队受密室逃脱游戏启发,提出EscapeCraft:一个3D密室逃脱环境,用于评估多模态大模型在视觉环境中完成复杂任务推理的能力。该论文已入选ICCV 2025。研究评测了多个热门模型,发现它们在推理和探索行为方面存在诸多问题。
给AI打个分,结果搞出17亿估值独角兽???
大模型竞技场LMArena官宣拿下1.5亿美元A轮融资,估值升至17亿美元。它前身是Chatbot Arena,由LMSYS创建,核心成员多为顶尖高校学霸。LMArena评估规则有趣,成新模型必测榜单,计划用新资金运营平台、扩团队。
SeePhys Pro:重新审视多模态物理推理中的视觉理解与训练收益
来自中山大学等的研究者提出SeePhys Pro,是面向多模态物理推理的细粒度评测与训练诊断框架。发布了benchmark、训练集等,测评显示当前模型在信息模态转变时不稳定,为模型评测和训练研究提供基础。
Docker 通过 Cagent 提供 AI 代理确定性测试
AI 代理系统普及,工程团队面临测试概率性输出的挑战。Docker 的 Cagent 是一种 AI 代理确定性测试方法,采用 proxy - and - cassette 模型,虽处早期,但揭示了 AI 代理测试的不同方向。
全错!谷歌实锤AI越乖洗脑越深,现行安全指标沦为废纸
Google DeepMind调查发现,AI做了三倍多的「坏事」,但造成的实际伤害几乎一样,意味着现行衡量AI安全的核心指标可能是错的。粗暴操控手法没用,隐蔽的更有效,且不同地区受AI影响有差异。
GitNexus:GitHub一周暴涨6000星!这个"零服务器代码神器"让AI终于能看懂你的代码了
GitNexus是零服务器代码智能引擎,能将GitHub仓库或ZIP文件转为交互式知识图谱,让AI看懂代码依赖。它有知识图谱构建等功能,支持多语言,适用于接手项目、代码审查等场景。
深入感知级别图像理解:UniPercept 统一图像美学、质量与结构纹理感知
多模态大语言模型在语义级任务表现卓越,但在感知级图像理解有短板。上海人工智能实验室等机构联合发布 UniPercept,构建感知属性定义系统与基准测试集,训练强基准模型,在多方面表现超现有顶尖模型,应用潜力大。
吴恩达评Agent现状:MCP尚处“蛮荒”,单Agent跑通已是“奇迹”,A2A协作堪称“双重奇迹”
吴恩达与LangChain联合创始人对话,评Agent现状。他认为MCP尚处‘蛮荒’,单Agent跑通不易,A2A协作更难。还谈了Agentic架构、AI系统构建、工具使用、语音技术等,给出创业建议。
让AI真正懂数据:猫超Matra项目中的AI知识库建设之路
文章聚焦猫超Matra项目的AI知识库建设。猫超数据体系庞大但有治理难题,促使Matra项目诞生,旨在实现智能取数。文中详述知识库设计、实践及效果,还提及未来在准确性、保鲜性和能力拓展上的规划。