「外推能力」共找到 3746 篇相关文章
北大发布学术搜索评测ScholarSearch:难倒一众DeepResearch的“开卷考试”
北京大学DS - Lab发布ScholarSearch,这是评估大语言模型学术检索能力的数据集,含223道高难度题目。评估显示现有模型表现欠佳,纯推理模型准确率低,有搜索功能的模型虽有提升但仍不足。
优理奇机器人完成两轮合计3亿元天使++++轮及天使+++++轮融资,“算法-硬件-场景”三位一体加速具身智能应用落地
优理奇机器人近日完成两轮合计3亿元融资,是半年内第五轮。其坚持“场景驱动”,产品在运动会获奖,量产交付订单超千台。构建完整技术栈,推出标准化机械臂产品,创始人看好具身智能统一发展。
DPad: 扩散大语言模型的中庸之道,杜克大学陈怡然团队免训推理加速61倍
扩散大语言模型(dLLMs)有全局规划能力,但存在计算冗余。杜克大学陈怡然团队揭示其“草稿纸机制”,提出免训练方法DPad,结合现有技术,能在几乎无损精度下实现高达61.4倍推理加速。
轻量级易开发,8B参数释放大实力!科学多模态模型Intern-S1-mini开源
上海人工智能实验室继7月26日开源后,推出轻量化版本Intern-S1-mini。它是8B参数“迷你模型”,兼具通用与专业科学能力,适合快速部署和二次开发,在多方面表现出色,还降低了对高端计算设备依赖。
深谋科技重磅发布真正为人类服务的新一代人形机器人核心技术「声波传感 · 意念控制 · 高精视觉 · 类脑智能」
深谋科技将在2025 WAIC展示陆上具身智能人形“美猴王”和空中具身智能巨兽“星汉一号”,并发布新一代人形机器人核心技术,包括传感、脑机交互等系统,构建具身智能全域系统闭环。
财报里的AI医生「大为」,撬动京东健康价值重估
京东健康AI医生「大为」让用户足不出户解决就医问题。财报显示其已覆盖超1000种病症,“618”服务用户数同比增近4倍,满意率超98%。它凭借数据、场景和履约能力实现问诊到服务落地,并探索长期健康管理。
挤干大模型高分「水分」!最强模型仅49分,南大傅朝友发布Video-MME-v2
南京大学傅朝友团队在 Google Gemini 评测团队邀约下推出视频理解新基准 Video-MME-v2。它有创新的分层能力体系与组级非线性评分,揭示模型与人类的巨大鸿沟、传统 Acc 指标虚高、“Thinking”并非总是增益等现象。
模力工场 033 周 AI 应用榜:从评论区互动到游戏陪玩,AI 已悄悄加载完成
模力工场 033 周 AI 应用榜发布,展示了 AI 在各领域的应用。各大厂选择在原有产品里做能力延伸,开发者将分散的 AI 功能整合。榜单涵盖学习、生活、娱乐等多领域应用,AI 更便利、隐形地融入日常。
OpenAI发布GPT-5.4:首个原生接管电脑通用模型
OpenAI发布GPT-5.4及满血版GPT-5.4 Pro,主打专业生产力。它具备原生电脑操作能力,视觉感知、职场任务表现提升,幻觉问题被压制,代码能力强,工具调用机制优化,已在ChatGPT等全量上线,API定价上调。
Meta 重金抢人,明星云集就能复制 DeepSeek 的成功吗?
Meta 扎克伯格亲自出手重金招人,组建豪华 AI 战队,核心领导与技术阵容都很强大。但天才招聘只是第一步,组织天才协同才关键。DeepSeek 团队规模小、扁平化,成功逆袭。Meta 难复制其成功,组织重构能力或更重要。