小实验」共找到 2228 篇相关文章

算法论文8

通义团队提出环境Scaling:自动构建环境,并自主学习和成长,可让30B比肩1T效果

阿里巴巴通义实验室团队论文提出通过程序化、自动化构建模拟环境,让语言模型自主交互学习。基于此训练的AgentScaler模型,数十亿参数就达万亿级模型性能,为轻量级代理智能发展带来新可能。

深度学习自然语言处理
算法论文8

华为超树HTP:不写示例、不调PDDL,AI规划约束通过率飙升62.6%

文章介绍华为超树HTP,它是完全自主、可泛化的推理新范式。能让LLM在超树结构上完成规划,不依赖人工示例和外部规划器,在复杂规划benchmark上实现SOTA准确率并降低token成本,还阐述其原理、创新点及应用实例。

CourseAI
算法论文8

自搜索强化学习SSRL:Agentic RL的Sim2Real时刻

本文由多机构联合完成,引入自搜索强化学习SSRL。它利用结构化prompt和format reward提取模型world knowledge,降低幻觉。还探索Sim2Real有效性,验证SSRL训练模型在真实场景泛化性,且所有训练数据等已开源。

机器之心
算法论文8

视频「缺陷」变安全优势:蚂蚁数科新突破,主动式视频验证系统RollingEvidence

蚂蚁数科AIoT团队论文提出主动式可信视频取证系统RollingEvidence,利用相机卷帘门效应嵌入物理水印,结合AI与概率模型验证,抵御伪造篡改,在检测准确率和防护能力上优于传统技术。

机器之心
算法论文7

AI 的“思维链”推理是海市蜃楼吗?

亚利桑那州立大学论文《大语言模型的思维链推理是海市蜃楼吗?》认为思维链推理在数据分布偏移时易出错,可能只是对训练数据模式的记忆。作者 Sean Goedecke 认为该论文结论不合理,从推理与语言、模型规模等方面提出反对意见。

宝玉AI
新闻资讯7

GPT-5正以o3的三倍速度打宝可梦,现已抵达冠军之路,直播进行中

GPT - 5直播独立运行宝可梦红版,速度比o3快近三倍,6105步抵达冠军之路,而o3需16882步。原因是其幻觉少、空间推理和规划能力强。直播已进行9时,超2000人关注,OpenAI总裁点赞。

AGI Hunt
算法论文8

1句话高质量生成游戏3D动作,北大新方法刷新动画制作SOTA

北京大学提出ReMoMask:基于检索增强生成的Text - to - Motion框架,集成三项关键创新。在标准基准测试上,相比RAG - T2M,在HumanML3D和KIT - ML上FID分数分别提升3.88%和10.97%。

量子位
新闻资讯7

Claude Opus 4.1代码实测惊人!OpenAI开源模型却只会写屎山?

昨日,OpenAI、谷歌和Anthropic等发布新模型。Anthropic推出Claude Opus 4.1,虽性能提升不大,但编码能力获大客户认可。实测显示Claude - Opus - 4.1写代码稳,OpenAI新模型表现不佳。

新智元
算法论文8

GPT-5刷屏吊胃口之际,英伟达发出暴论:型语言模型才是未来

英伟达新论文指出,未来属于型语言模型(SLM),挑战了智能体需用大型语言模型(LLM)的假设。SLM参数量低于100亿,有低延迟、低成本等优势,还给出从LLM到SLM迁移路线图。

AGI Hunt
新闻资讯7

老黄自曝刚报废50亿美元显卡!亲自审查4.2万名员工薪酬,100%都加薪

黄仁勋在采访中透露报废50亿美元显卡,坚持先下单先得分配H100芯片。他亲自审查员工薪酬,称100%会加薪。认为AI是伟大“技术均衡器”,天价AI合同合理,还谈及芯片保值、中美AI竞赛等话题。

新智元