「外推能力」共找到 3746 篇相关文章
AI实力榜大洗牌!OpenAI谷歌强势领跑,Anthropic节节败退
Poe最新报告显示,2025年1 - 5月AI各领域市场份额大洗牌。OpenAI和谷歌势头猛,Anthropic掉队。文本生成、推理、图像等各领域竞争激烈,企业需搭建评估体系,按需选模型。
LLM的“记忆外挂”来了!Supermemory新API:一行代码让LLM记忆“无限+省钱90%”
Supermemory公司发布Infinite Chat API,能让任何LLM有近乎无限上下文长度。用户一行代码就能切换,可扩展上下文、省90%成本、提性能,已上线,有免费试用额度,后续有固定费用和用量计费。
Anthropic推演2030年美国经济:AI时代,钱流向了有钱人
本文解读Anthropic最新AI影响经济研究报告,报告从任务层面建模,设置三种AI发展情景,推演2030年美国GDP、就业与收入分配的变化。
OpenAI连破10道数学难题,Fable 24小时「复现」5道
这个周末,OpenAI与Anthropic两大AI巨头在数学前沿短兵相接。先是OpenAI用未发布模型Astra证明10项数学成果,不到24小时,Anthropic的Fable复现了其中5项。AI解难题成本降低,成果验证成新考验。
Claude Code惊人身世曝光!竟脱胎于安全对齐,Boris:才完成1%
Claude Code起源于Anthropic内部安全对齐项目,其发展历经波折。从2021年早期尝试,到2025年正式发布,期间突破重重技术难题。虽已改变硅谷运转方式,但核心开发者Boris称只完成1%。
从答题到做实验:SciAgentGym让大模型进入科学工作流
复旦大学NLP实验室提出SciAgentGym,为科学智能体搭建工作流环境,还设计了评测集SciAgentBench。实验显示模型接入工具能提升成功率,但长流程任务性能下降。论文还提出SciForge构建训练数据,提升了模型表现。
当「提示词工程师」开始像制片人一样思考,Seedance 2.0 Skill OS 深度解析!
AI 视频工具圈存在模型强但使用方式单一、信息孤岛和提示词‘玄学化’问题。`seedance - 2.0` 仓库搭建‘操作系统’,将‘提示词’升级为可审计制作流程,还给出各岗位产出表和使用方式。
具身智能迈入下半场,RoboMemArena全面评测机器人记忆系统
香港科技大学(广州)等多机构打造具身智能评测基准 RoboMemArena,突破传统局限,构建综合评测体系,配套真机测评。它提供多模态标注,任务长程多样,开源资源易用,PrediMem 在其上表现出色。
DMLR 2026 | RPI Shaowu Pan(潘韶武)团队 Nithin Somasekharan等:CFDLLMBench——首个面向计算流体力学的大语言模型综合基准评测
文章介绍针对CFD领域的综合LLM评测基准CFDLLMBench,构建三层递进挑战体系。实验揭示主流LLM在‘知道’与‘做到’间有差距,多智能体框架可提升成功率,代码与数据集已开源。
24小时、78轮实验、持续迭代,AiScientist自己把最优解一步一步逼出来了
中国人民大学高瓴人工智能学院的AiScientist挑战让AI持续推进研究工程。它采用“thin control over thick state”设计,通过分层编排和File - as - Bus等方式,在多任务上表现出色,为AI科研工程补上关键底座。