研究任务」共找到 3521 篇相关文章

新闻资讯8

让AI学会潜意识推理,Sapient发布类脑模型HRM

新加坡初创公司Sapient Intelligence发布仅2700万参数的分层推理模型HRM,在多项高难度推理任务上超越大模型。它绕过大模型推理困境,借鉴大脑机制,训练效率高,开源后GitHub星标突破10.3k。

AIGC开放社区
产品应用8

代码智能体占领GitHub!自动修bug、加功能、写文档,一台手机就能指挥

GitHub上新代码智能体Copilot Coding Agent,可自动修bug、加功能、写文档,开发者评价很棒。在手机APP就能操作,还能同时分配多任务。微软宣布VSCode中GitHub Copilot将开源,还发布多项新功能。

量子位
产品应用7

10万智能体同场模拟,YuLan-OneSim带来真正的大社会实验

YuLan-OneSim是大语言模型驱动的社会模拟器,能模拟人类社会行为。它可零代码构建场景,有50个默认场景,具分布式架构,支持10万智能体同场模拟,还推出AI社会研究员,自动完成社会科学研究流程。

带你学AI
产品应用7

我给剪辑产品 0 元雇了个外部研发部:它开始自进化

作者的剪辑产品有了“外部研发部”——Agent。它每天研究新方法、用真实项目测试。作者三步搭建此“研发部”,让其自动查询、测试和汇报,自己负责最终决策,项目获取新方法不再只靠偶然。

AI产品自由
新闻资讯8

王阳明心学,被Anthropic用来教Claude做人了

UT Austin哲学教授Harvey Lederman研究王阳明心学十年,现加入Anthropic做Claude对齐训练。他用分析哲学拆解“知行合一”,发现AI模型存在“信念冲突”,Anthropic用类似阳明心学方法解决问题。如今硅谷AI公司争抢哲学家。

量子位
算法论文8

谷歌分布式训练开启另一轮扩展定律!百万芯片高压高故障仍然零全局停机

谷歌Decoupled DiLoCo研究打破大模型训练锁步模式,让集群各部分异步汇合。模拟数百万芯片高压训练时零全局停机、性能无损,还能提升系统有效工作时间,有算力撷取和异构计算等红利。

AIGC开放社区
算法论文8

二元成功率已经过时!PRM-as-a-Judge才是你需要的具身操作评测框架

传统二元成功率评测具身操作任务有局限,难回答策略推进、执行效率等问题。中科院自动化所等机构研究人员提出PRM - as - Judge框架,含进度势能、OPD指标体系和RoboPulse基准,能细粒度审计执行过程。

机器之心
开源动态8

腾讯纯文本LLM训视觉encoder,拿捏图表长视频,达到开源小模型SOTA!

腾讯开源Penguin - VL,直接用纯文本LLM训视觉编码器,跳出传统多模态拼接套路。在2B/8B紧凑参数规模的复杂任务中竞争力强,训练分三阶段,相关代码、模型等已开放。

量子位
算法论文8

大语言模型逻辑评估

现有归因问答评估方法有‘归因短视’问题,研究团队提出 LOGICSCORE 框架,从三维度量化推理质量。在多数据集测试多款 LLM,发现专有、开源模型等存在不同逻辑问题,还分析典型逻辑错误。

深度学习自然语言处理
新闻资讯8

Anthropic这两天真没闲着:上线网页版Claude Code,还让Claude搞科研

Anthropic推出Claude Code网页版,无需本地安装命令行工具,还提供Claude iOS应用预览版。其有并行处理多任务等亮点。此外,还发布Claude生命科学版,搭载Claude Sonnet 4.5模型,能助力科研。

AI前线