「高级推理测试」共找到 3465 篇相关文章
“零人”搞医学研究:清华AI智能体从灵感到论文全程自主
清华大学自动化系索津莉课题组发布全自主AI研究框架OpenLens AI,实现医学研究全链条自动化闭环,解决医疗信息学研究效率困局,将科研周期从“月级”缩至“小时级”,还在质量控制上设新标杆。
黄仁勋出手!45倍性能暴涨,英伟达定义物理AI新纪元
在SIGGRAPH 2025上,英伟达发布「物理AI」全家桶。展示完整生态,含新硬件、仿真平台和AI模型。如RTX PRO 6000服务器显卡性能涨45倍,还推多款模型,应用于多领域,推动物理AI落地。
推荐!5分钟上手Chrome MCP,替代5个付费AI
作者测试发现Chrome MCP能替代大部分付费AI工具,如Cubox、音频工具等。它能让Claude控制浏览器,操作简单,1小时可配置,还能年省2000元,提升效率。
OpenAI谷歌Anthropic罕见联手发研究!Ilya/Hinton/Bengio带头支持,共推CoT监测方案
OpenAI、谷歌DeepMind、Anthropic联合发表立场文件,提出CoT监测概念,认为是控制AI Agent核心方法。探讨其潜在机遇、局限,还提及不同公司对CoT监测的不同态度,如OpenAI乐观,Anthropic焦虑。
谷歌AI试穿神器真神了!上传照片秒出OOTD,视频效果和照镜子没区别
谷歌推出应用Doppl,上传照片就能看到衣服“穿”在自己身上的效果,还能生成动态视频。它不仅能试穿,还会帮忙搭配。此外,Google Labs还有Portraits、文生视频产品Flow等小实验。
先设计再写代码,还是先实现再重构?AI 编程让这种选择变的简单
传统手工编程时代,先设计再写代码和先实现再重构存在争论。AI编程让选择变简单,可先设计生成代码,再改进设计生成。还需在开发工具和流程上配合,新人更易适应。
直播预约 | Evaluation论文分享@ICML&ACL2025
2025年6月11日20:00将直播分享Evaluation论文。多位嘉宾参与,涉及SyncPL奖励建模、文本事实一致性验证、大模型评测方法等多领域论文,涵盖模型优化、基准测试等内容。
奖励是假的,能让Qwen提升25%性能却是真的!
华盛顿大学博士生团队用Qwen模型对虚假奖励进行RLVR,使MATH - 500准确率显著提升约25%。研究发现RLVR不考虑奖励正确性,还分析了虚假奖励有效的原因,提示现有研究要在非Qwen模型验证。
InfoDeepSeek:首个开放网络环境下的智能体信息搜寻质量评估基准
上海交通大学与华为诺亚方舟实验室联合推出InfoDeepSeek,它是首个评估真实动态网络环境下智能体信息搜寻质量的基准。该基准有挑战性问题、真实动态环境等亮点,还开展实验揭示智能体行为特性。
字节开源高效解析文档图像的新型多模态模型Dolphin,快速将复杂的文档图像转化为结构化数据。
字节开源新型多模态模型Dolphin,采用“先分析后解析”范式,能将复杂文档图像转化为结构化数据。它有卓越性能和多种特性,还提供安装、推理使用指南。