「纯语言能力」共找到 4086 篇相关文章
代季峰陈天桥联手AGI首秀炸场!最强开源深度研究模型,GAIA测试82.4分超OpenAI
MiroMind ODR是代季峰加盟陈天桥后的技术首秀,GAIA测试82.4分超OpenAI。它全开源可复现,包括MiroFlow、MiroThinker等四个子项目。团队还曾推出MiroMind - M1,专注提升数学推理能力。
史上最大高质量科学推理后训练数据集开源,快速让Qwen3等变“科学家”
上海创智学院、上海交通大学发布开源科学推理后训练数据集MegaScience,含约125万条问答对,覆盖多学科。它解决了现有数据集的问题,实验显示能提升模型科学推理能力,已完整开源相关组件。
AI真的需要「像人类」那样思考吗?AlphaOne揭示属于大模型的「思考之道」
近年大模型在推理任务有进展,但缺乏推理节奏调控能力。伊利诺伊大学厄巴纳 - 香槟分校和加州大学伯克利分校研究提出 AlphaOne 框架,引入 α - moment 实现无需训练的推理调控,实验显示其能提升准确率和效率。
AI还不会独自问诊,o3准确率仅为51.12%,上交大×SII开源高难度复杂疾病诊断测评集
上海交大与SII团队开源高难度复杂疾病诊断测评集DiagnosisArena。测试显示,现有大模型在复杂临床诊断任务中表现不佳,o3准确率仅51.12%,且选择题设置无法反映其真实能力。
ICML 2026获奖论文揭晓:黄高团队获杰出论文,A3C算法获时间检验奖
ICML 2026公布最佳论文奖项,共10篇获奖,涵盖杰出论文奖、杰出立场论文奖等。此次评选严格,经多轮筛选。获奖论文涉及扩散式大语言模型、扩散模型采样算法等多个领域。
彻底告别VE与VAE!商汤硬核重构多模态:砍掉所有中间编码器
商汤科技联合南洋理工大学发布NEO - unify,这是“原生、统一、端到端”多模态模型架构,砍掉VE和VAE,用混合变换器架构打通视觉与语言能力,提升数据与算力利用效率,为跨模态智能系统奠基。
自建一个 Agent 很难吗?一语道破,万语难明
作者分享给传统研发平台接入 Agent 开发能力的经验,介绍技术选型、方案落地、系统提示词优化、知识库建设等内容,还提及工具接入、上下文管理等方面,为想自建 Agent 的人提供启发。
倒反天罡!Claude「反向」操控人类,公司估值冲2万亿跃居全球第二
2026年1月17日,一段‘AI指挥人类写代码’视频刷屏,Claude Code能力引发关注,模糊人机交互界限。18日《金融时报》称红杉资本将参与Anthropic新一轮融资,其估值冲向3500亿美元,或成2万亿级AI独角兽。
17万白领岗消失!Scale AI最新研究:AI仅动用了3%实力
新智元报道,近期多家巨头裁员17万,AI成“罪魁祸首”。但Scale AI和Center for AI Safety研究指出,全球六大顶尖AI自动化率不到3%,新基准RLI评估显示其执行有经济价值项目能力有限。
首个自主数据科学的智能体
DeepAnalyze是业界首个能自主完成数据科学任务的智能体大语言模型,可自动执行数据准备、分析等任务,支持多种数据源,且模型、代码等全部开源,还给出了使用和开发方法。