可灵O1模型」共找到 9990 篇相关文章

算法论文8

全球顶尖AI做物理,被人类按地摩擦?不懂推理大翻车,本科生碾压

港大等机构用3000道物理题测试顶尖大模型,如GPT - 4o、Claude 3.7 Sonnet等,结果模型准确率远低于人类专家。研究推出PHYX基准测试,揭示模型依赖知识、公式和模式匹配,缺乏真正物理理解。

新智元
新闻资讯7

Kimi K2里找到了DeepSeek V3架构

Kimi新模型K2热度高,在多benchmark上达SOTA,网友好评多。Kimi工程师透露K2开源原因,还谈及Kimi发展策略。实测显示K2在前端制作、工具调用、创意写作上表现出色。此外,OpenAI开源模型推迟,引发猜测。

量子位
算法论文7

LLM也会emo,Claude玻璃心、Gemini社恐,Kimi/GLM/ DeepSeek如何?

华东师大和复旦大学研究8大模型家族是否有“情感链”。实验覆盖8大家族20+模型,发现各家族有独特“人设”,如Claude像“文艺青年”。还揭示模型在不同情境下的情绪变化及影响,给出实用建议。

PaperAgent
新闻资讯7

Claude与人类共著论文,苹果再遭打脸!实验黑幕曝光

苹果一篇质疑大模型推理能力的论文引发争议。Open Philanthropy研究人员联手Anthropic发表论文,揭露苹果论文三大缺陷,指出部分测试无解却让模型“背锅”,还给出正确评价大模型推理能力的方法。

新智元
新闻资讯7

The Batch: 944 | Llama 之后的时代

Meta发布首个AI模型Muse Spark,是多模态推理模型,在部分健康和多模态测试领先,编程与智能体任务有不足。Meta披露技术细节少,该模型基准测试有竞争力,但其从开放转向封闭引开发者担忧。

DeeplearningAI
产品应用8

那个用半成品刷爆SOTA的Qwen3超大杯推理版,现在正式上线

阿里千问率先发布Qwen3-Max-Thinking正式版,刷新全球SOTA。该模型总参数超万亿,有技术创新,提升了推理性能和原生Agent能力。实测代码和工具调用能力强,还透露技术细节,中国开源模型影响力不断提升。

量子位
开源动态8

阿里达摩院开源具身大脑基模:3B激活参数性能超越72B,转身就忘事的机器人有救了

阿里达摩院开源RynnBrain具身大脑基础模型,全系列7个。它是业界首个有 时空记忆的模型,在20项具身Benchmark上超顶尖模型。具小而美优势,训练用自研架构提效,数据丰富,输入输出活。

量子位
算法论文8

必须得让AI明白,有些不该碰的东西别碰(doge)

近期类o3模型在视觉推理任务表现优异,但陷入‘盲目用工具’状态。港中文MMLab等团队提出AdaTooler-V模型,具备自适应工具使用能力,还引入指标、算法,构建数据集,在多基准测评中优势明显。

量子位
新闻资讯8

更会聊天、主打情绪价值,OpenAI 发布 GPT-5.1

今天凌晨,ChatGPT 模型升级为 GPT-5.1,官方主打更智能、更具对话性。它有 GPT-5.1 Instant 和 GPT-5.1 Thinking 两个子模型,本周内逐步向所有用户免费开放。升级重点在模型能力和个性化设置。

Founder Park
新闻资讯7

吴恩达来信:人工智能竞赛中的国家利益

中国在人工智能领域发展动能强劲,虽美国领先,但中国开源权重模型生态活力足,半导体也在进步。不同国家在人工智能不同领域各有优势,中国开源模型紧随美国专有模型,激烈竞争或孕育强大公司。

DeeplearningAI