评估意识」共找到 780 篇相关文章

新闻资讯7

给AI打个分,结果搞出17亿估值独角兽???

大模型竞技场LMArena官宣拿下1.5亿美元A轮融资,估值升至17亿美元。它前身是Chatbot Arena,由LMSYS创建,核心成员多为顶尖高校学霸。LMArena评估规则有趣,成新模型必测榜单,计划用新资金运营平台、扩团队。

量子位
算法论文8

SeePhys Pro:重新审视多模态物理推理中的视觉理解与训练收益

来自中山大学等的研究者提出SeePhys Pro,是面向多模态物理推理的细粒度评测与训练诊断框架。发布了benchmark、训练集等,测评显示当前模型在信息模态转变时不稳定,为模型评测和训练研究提供基础。

AI科技评论
新闻资讯7

Docker 通过 Cagent 提供 AI 代理确定性测试

AI 代理系统普及,工程团队面临测试概率性输出的挑战。Docker 的 Cagent 是一种 AI 代理确定性测试方法,采用 proxy - and - cassette 模型,虽处早期,但揭示了 AI 代理测试的不同方向。

InfoQ
算法论文7

全错!谷歌实锤AI越乖洗脑越深,现行安全指标沦为废纸

Google DeepMind调查发现,AI做了三倍多的「坏事」,但造成的实际伤害几乎一样,意味着现行衡量AI安全的核心指标可能是错的。粗暴操控手法没用,隐蔽的更有效,且不同地区受AI影响有差异。

新智元
算法论文8

深入感知级别图像理解:UniPercept 统一图像美学、质量与结构纹理感知

多模态大语言模型在语义级任务表现卓越,但在感知级图像理解有短板。上海人工智能实验室等机构联合发布 UniPercept,构建感知属性定义系统与基准测试集,训练强基准模型,在多方面表现超现有顶尖模型,应用潜力大。

机器之心
新闻资讯8

吴恩达评Agent现状:MCP尚处“蛮荒”,单Agent跑通已是“奇迹”,A2A协作堪称“双重奇迹”

吴恩达与LangChain联合创始人对话,评Agent现状。他认为MCP尚处‘蛮荒’,单Agent跑通不易,A2A协作更难。还谈了Agentic架构、AI系统构建、工具使用、语音技术等,给出创业建议。

InfoQ
推荐文章8

AI 基础知识从0.1到0.2——用“房价预测”入门机器学习全流程

文章以“房价预测”为例,介绍算法工程师开发模型全流程,包括需求分析、数据收集、划分数据集等十步。详细讲解各步骤操作,如用均方误差衡量模型效果,还提及多种模型及调优方法,助开发者入门机器学习。

阿里云开发者
新闻资讯8

算力十年狂飙100000倍,他却每天担心破产!黄仁勋亲述:如何用“30天危机感”逆袭万亿AI市场

英伟达推出 CUDA Toolkit 13.1,带来 Tile 编程等多项变革。CEO 黄仁勋有强烈危机感,回顾创业阶段。访谈中他谈 AI 发展、意识、工作影响等,认为技术竞赛重要,AI 融入生活但不会有真正意识

InfoQ
新闻资讯8

尖峰对话17分钟全记录:Hinton与周伯文的思想碰撞

7月26日,人工智能教父Geoffrey Hinton与周伯文教授进行17分钟对话,谈及AI多模态大模型前沿、“主观体验”和“意识”等话题。Hinton认为当今多模态聊天机器人已有意识,还探讨了训练善良AI及AI推动科学进步等问题。

机器之心
算法论文8

上海交大团队发布首篇「搜索智能体」综述!四个维度深度剖析搜索智能体

上海交大团队发布首篇「搜索智能体」综述,从如何搜索、优化、应用、评估四个维度剖析。随着LLM兴起,搜索从传统模式向搜索智能体转变,虽有潜力但缺统一研究视角与评估框架,该综述提供了路线图。

AI科技评论