「推理训练数据」共找到 5204 篇相关文章
字节Seed最新版原生智能体来了!一个模型搞定手机/电脑/浏览器自主操作
字节Seed发布最新版原生智能体UI - TARS - 2,采用All in one原生设计,表现优于Claude和OpenAI Agent等。它通过多轮强化学习,解决智能体操作图形界面的四大难题,在多测试中表现出色。
科研智能体「漫游指南」—助你构建领域专属科研智能体
该综述提供科研智能体构建指南,提出三级分级系统,阐述构建流程与能力增强方法,涵盖知识组织、注入、工具集成,还提及基准评估和未来研究方向,促进AI与自然科学融合。
不愧是中国机器人,乒乓打得太6了
清华姚班本科生苏智团队在论文中提出结合模型规划与强化学习的分层框架,让宇树G1机器人实现亚秒级反应下的稳定连续对打,在真实实验中击球和回球率高,还能连打106拍。
OpenAI和Anthropic罕见互评模型:Claude幻觉明显要低
OpenAI和Anthropic罕见合作,互相授予API权限评估模型安全与对齐情况并发布报告。双方派出多模型参与,从指令层次、越狱、幻觉、欺骗策略等方面评测,呈现各模型优缺点。
一场「狼人杀」,考倒了一堆大模型
南开大学等机构设计 InMind 评测框架,在 Avalon 游戏对 11 个前沿大模型测试。多数模型停留在表层模仿,仅少数推理增强模型有初步‘风格敏感性’,未来人机交互应关注‘像不像’。
空间智能卡脖子难题被杭州攻克!难倒GPT-5后,六小龙企业出手了
杭州群核科技发布空间大模型,深耕室内场景,直指‘空间一致性’痛点。其开源子模型具真实感全息漫游、可交互等特点。当前空间模型处早期,群核提出‘三位一体’战略,还将开源促行业发展。
首创郎园聚焦AI视听|北京AIGC视听产业创新中心启动!
8月19日,北京AIGC视听产业创新中心启用。朝阳区发布“政策服务包”,首创郎园公布“六大服务平台”,联合推出数据交易平台。此外,还发布人才计划、揭牌产教融合实验室,启动测评季活动。
陶哲轩「断粮」后,25年首次绝望怒吼:美国科学命脉被砍断!
美籍华人数学天才陶哲轩称,25年科研生涯从未如此绝望。白宫切断其科研经费,UCLA等科研圣地也濒临断粮。美国科研体系半年内遭‘血洗’,诸多项目中断,未来堪忧。
Meta视觉基座DINOv3王者归来:自监督首次全面超越弱监督,商用开源
Meta推出并开源视觉基础模型DINOv3,采用自监督学习,首次全面超越弱监督,可生成高质量高分辨率视觉特征。它在多任务表现出色,参数和数据量提升,还构建模型家族,已在多领域产生实际影响。
强化学习+MCP=王炸?开源框架教AI在MCP中玩转工具解决任务,实测效果超越GPT!
科技公司OpenPipe提出全新开源强化学习框架MCP·RL,只需一个MCP Server地址,agent就能自动发现工具、生成任务,在闭环反馈中摸索出最优调用策略,实测在2/3的benchmark上达或超SOTA性能。