看表测试」共找到 2198 篇相关文章

算法论文8

ICML 2025 | 清华、上海AI Lab提出专家级医学基准MedXpertQA,o3、R1哪家强

本文由清华和上海AI Lab学者撰写,提出专家级医学基准MedXpertQA。现有医学基准难度和临床相关性不足,而MedXpertQA极具挑战、临床相关性高,构建严格,评测显示前沿模型在医学领域提升空间大。

机器之心
推荐文章7

我押注12亿美元买下当年移动界的“OpenAI”,却眼睁睁它49天夭折

本文讲述 WebOS 系统兴衰史。惠普前 CTO Phil McKinney 力主 12 亿美元收购有潜力的 WebOS,但因 CEO Leo Apotheker 决策失误,系统 49 天夭折。这警示决策需系统性思维框架。

InfoQ
推荐文章7

新手必!强化学习入门指南 | 从RLHF、PPO、GRPO到RLVR,最后到训练推理模型

Unsloth团队发布强化学习教程,从吃豆人谈起,介绍RLHF、PPO、GRPO等概念,分享用GRPO训练推理模型技巧。涵盖强化学习基础知识,还给出Unsloth使用GRPO训练模型方法及奖励函数示例。

AINLPer
产品应用8

Agent 成大厂新“战场”?从同程旅行 DeepTrip 垂类 Agent 的设计与落地实践

文章聚焦同程旅行推出的垂类旅行 Agent DeepTrip,介绍其设计与落地实践。它能降低旅行决策成本,构建旅行服务生态。团队基于多方面考量选 Agent 架构,还从多维度介绍实现方法及未来规划。

InfoQ
新闻资讯7

AI狂飙100天,中国力量突起!顶流视频号10分钟尽全球最强杀招

2025年开年,全球AI版图重绘,从中国DeepSeek开源风暴到OpenAI闭源反击,双方在算力、模型等层面激烈碰撞。各月双方均有新动作,4月AI迈入全民普及,新智元联合视频号推出活动助掌握科技风向。

新智元
算法论文7

VQA高分是在图,还是在记答案?ReKey只更新决定答案的那一小块

视觉问答模型准确率提升,但高分可能源于记忆。浙江大学等团队提出 ReKey,保留真实场景,只更新决定答案的视觉线索,使评测面向未见过内容,且多数环节可自动完成。

机器之心
新闻资讯8

从美国能源部“创世纪计划” AI for Science:走向更完整的科学闭环与科研组织方式重构

近日,美国能源部公布“创世纪计划”首批入选资助谈判项目名单,反映AI for Science深刻演变,从理论探索走向实际应用,科研组织方式也在重构。本文从多维度拆解名单背后的战略布局与演进趋势。

力学与人工智能
新闻资讯7

GEO最新风向:Google官方GEO分享与Bing站长工具GEO新功能,附白杨SEO

本文整理谷歌和必应官方GEO分享。Google的Danny Sullivan谈AI搜索,强调好SEO即好GEO,内容要非同质化;Bing预告站长工具GEO新功能,如优化建议、引用份额指标等。

白杨SEO优化教程
开源动态8

「世界理解」维度AI视频生成:Veo3和Sora2水平如何?新基准来了

近年来,T2V模型进展显著,Sora2爆火引发对其是否为‘世界模型’的探讨。传统基准无法系统衡量模型对事件因果等的理解,中山大学等团队提出新评测框架VideoVerse,评测主流模型并发现开源与闭源模型差距及各模型缺陷。

量子位
新闻资讯7

10个视频9个走眼:连真视频都打Sora水印碰瓷,这世界还能信啥?

互联网充斥AI造假视频,真假难辨,造成诸多困扰。虽有部门要求打水印,OpenAI也如此,但有人给真视频打Sora水印。现有AI检测工具各有局限,检测技术发展任重道远。

机器之心