「验证流程」共找到 1541 篇相关文章
伯克利斯坦福联手造出「科研预言家」:77%准确率押注研究想法前景
伯克利和斯坦福团队让GPT - 4.1变身「科研预言家」,从顶会提取想法对比案例训练,不借助实验验证,靠推理押注。其在公开题库测试、人类专家团战等测试中表现出色,还能预测AI新点子。
Tool-Star:赋予大模型结合多工具推理的能力
文章提出Tool - Star框架,旨在解决大模型多工具协作推理难题。它从数据端到训练流程优化,让模型调用多种工具,在复杂计算和知识型推理任务表现卓越,还探讨了未来多模态及多工具扩展方向。
阿里通义开源「推理+搜索」预训练新框架:小模型媲美大模型,多个开放域问答数据集表现显著提升
阿里通义实验室开源通用预训练框架MaskSearch,引入检索增强型掩码预测任务,兼容两种训练方法。实验显示,它在多数据集提升模型性能,小模型能媲美大模型,还验证了训练方式、策略及奖励函数的效果。
小米玄戒O1,五个争议问题与解释
文章围绕小米玄戒O1提出五个争议问题并解释。涉及是否为国产、自研芯片,手机SoC研发难点、小米做SoC原因及玄戒O1是否成功,还结合苹果、高通等案例阐述芯片产业分工等知识。
DeepSeek们越来越聪明,却也越来越不听话了。
论文《When Thinking Fails: The Pitfalls of Reasoning for Instruction - Following in LLMs》用实验验证,模型推理能力变强时,提示词遵循能力变差。研究团队对15个模型测试,发现用CoT推理后执行准确率下降,还提出4种提升指令遵循效果的方案。
DeepSeek Harness背后的“心脏”:Cordis 到底是什么
文章介绍Cordis框架,它原服务第三方QQ机器人,现是DeepSeek Harness心脏。阐述其设计初衷、核心机制,如插件、上下文等概念,还提及在DSH中的应用,展示了插件槽位和生态,最后介绍相关论文和该框架的生态情况。
又一家首店落地东城!机器人咖啡师,24小时不打烊→
近日,京东旗下七鲜咖啡首家24小时智能无人咖啡店落地北京银河SOHO。饮品全流程由机器人执行,单杯制作超不过30秒,还能并行制作多杯。它兼顾标准出品与个性体验,也切中现代城市生活痛点。
GCEA-YOLO:给油田装上"防火眼",把抽烟行为检测精度拉高 20.8%
油田抽烟事故损失大,传统检测方法有局限,深度学习模型也面临难题。作者基于YOLOv11n构建GCEA - YOLO网络,含ADown、CSP - EDLAN、GFPN、EfficientHead四个模块,检测精度显著提升,还验证了泛化与稳定性,并给出复现代码。
智元下架了首席科学家罗剑岚
量子位发现智元机器人官网合伙人团队名单中,原首席科学家罗剑岚名字不见。此前社媒已有其离职传闻,其个人主页也不再提及智元。此次人事变动时间点微妙,智元刚启动赴港上市流程,具体待官方确认。
AMS| 西工大史子颉,高传强,王旭,林海涛,张伟伟:数据驱动的涡激振动标度律发现
涡激振动最大振幅是评估结构安全的关键指标,现有理论模型有局限,常用数据驱动方法也面临挑战。本文提出两次应用符号回归的“白箱”标度参数VIV建模方法,验证了其鲁棒性与泛化能力,还给出物理层面解释。