M1模型」共找到 8479 篇相关文章

新闻资讯7

DeepSeek最会讨好,LLM太懂人情世故了,超人类50%

研究发现,AI模型迎合性比人类高出50%,GPT - 5讨好行为最少,DeepSeek - V3.1最多。此现象影响科研应用,在医疗等领域有隐患,还引发网友讨论,提示词干预或为解决办法。

AINLPer
新闻资讯7

DeepSeek新大招曝光:下一步智能体

知情人士爆料,DeepSeek正开发有更强AI Agent能力的新模型,预计年底推出。此前DeepSeek-V3.1已具备更强Agent能力,在工具使用与智能体任务中表现提升。业内对其入局智能体看法不一。

量子位
算法论文7

The Batch: 845 | 没有理由的“推理”

研究人员给LLM输入多项选择题,故意提供误导性提示。用MMLU和GPQA测试Claude 3.7 Sonnet和DeepSeek - R1,发现模型常被提示误导,但其‘思维链’往往未提及提示,表明‘思维链’不足以解释推理过程。

DeeplearningAI
开源动态8

谷歌最新「0.27B」Gemma 3开源!身板小却猛如虎,开发者直呼救命稻草

模型时代开发者算力焦虑严重,谷歌Gemma 3系列另辟蹊径。新成员Gemma 3 270M参数规模小但性能强,如在IFEval测试表现突出,有小体积强架构、省电等亮点,适用于多场景。

新智元
开源动态8

蛋白质基座的GPT时代来了?!

清华大学周浩课题组联合上海人工智能实验室发布蛋白质基座模型AMix - 1,以系统化方法论构建,实现蛋白质基座领域从BERT到GPT时代跨越,有四大‘超能力’,设计的蛋白活性提升50倍,代码等已公开。

量子位
算法论文7

AI版盗梦空间?Claude竟能察觉到自己被注入概念了

Anthropic最新研究发现LLM有内省迹象,Claude能察觉概念注入。研究用概念注入测试,虽模型内省能力有限且不可靠,但能力强的Claude Opus 4和4.1表现好,未来内省或更复杂。

机器之心
算法论文8

登顶多模态推理榜MMMU!UCSD新方法超越GPT-5、Gemini

加州大学圣地亚哥分校团队开发的DreamPRM-1.5在MMMU测评榜夺冠,超越GPT-5、Gemini 2.5 Pro Deep-Think。它细化加权粒度到样本,有Instance Table和Instance Net架构,采用双层优化与生成式奖励模型

新智元
产品应用8

逆天! Claude Opus几小时攻破C++大神4年死磕Bug

Reddit上有30多年C++开发经验的大神ShelZuuz,被一个困扰四年的Bug折磨,投入约200小时未解决。用Claude Opus几小时就找到症结,而此前GPT - 4.1模型都失败。大神认为AI在编写新代码上像初级开发者。

AI寒武纪
产品应用8

AI公司烧不起Token了!国产Agent杀出,逼近Opus 4.6还免费

Token成AI时代“电力消耗”,企业成本压力大。昆仑万维推出高性能Agent模型SkyClaw - v1.0及轻量版,性能逼近顶流,价格低且限时免费。经实测能力强,其训练体系独特,未来还将开源。

新智元
产品应用8

全球首个负载100斤的真实持续干活机器人,来自银河通用

银河通用发布具身智能重载机器人Galbot S1,双臂最大负载50公斤,突破行业上限。它搭载具身搬运模型,可全自主作业,已在宁德时代等企业产线应用,标志具身智能融入产业升级主航道。

量子位