「长思考能力」共找到 4087 篇相关文章
GPT-5刚刚正式发布,首次面向免费用户开放
OpenAI正式发布GPT - 5,有架构统一、性能大幅提升、全用户开放三大核心变化。测试数据显示性能进步明显,采用新定价策略面向所有用户开放。但演示未带来突破感,编程能力还面临Claude Opus 4.1挑战。
Qwen紧追OpenAI开源4B端侧大模型,AIME25得分超越Claude 4 Opus
Qwen团队深夜开源两个端侧模型Qwen3 - 4B - Instruct - 2507和Qwen3 - 4B - Thinking - 2507,尺寸对端侧友好,支持256k上下文。后者在AIME25测评得分超Claude 4 Opus,两模型能力较前作均有提升。
AI打假AI,拿下SOTA丨厦大&腾讯优图
厦门大学联合腾讯优图实验室团队提出AIGI - Holmes方法,创新性采用“大模型+视觉专家”协同架构,解决现有AIGI检测技术瓶颈,在检测、解释能力及鲁棒性评估上均取得最优效果。
Gemini 2.5 Pro强势更新并霸榜,Claude 3.7首次遭遇全方位碾压!
Google DeepMind推出的Gemini 2.5 Pro在LMArena各大排行榜全面登顶,实现文本、视觉、Web开发全方位霸榜,编码能力也大幅升级。虽有质疑,但短期内难有对手,还引发对Google I/O大会更多惊喜的期待。
DeepSeek低价风暴打服硅谷!海外平台争相倒贴V4 Flash
DeepSeek V4 Flash掀起价格风暴,全球开发者为之疯狂。海外平台如Nous Portal、Cline等纷纷补贴,其能力大幅提升,价格却极低,让开发者更愿尝试开源模型,AI应用层或迎转机,且DeepSeek Code可能将至。
Claude新模型危险,鲍威尔召集华尔街紧急开会!全美安全股暴跌2万亿
Anthropic的新模型Mythos能力超强,被指或对金融业造成重大风险。鲍威尔和贝森特紧急召集华尔街开会预警。消息传出,美国软件板块暴跌,SaaS领域近2万亿美元市值蒸发。Anthropic拒绝向公众发布该模型,启动防御项目。
1.9K Star 微软开源TTS王炸!90分钟超长语音合成,4人对话自然切换!
在文本转语音(TTS)领域,生成长篇、多说话人的高质量音频一直是技术挑战。微软最新开源的VibeVoice TTS模型,可一次生成90分钟连续语音,支持4个不同说话人,还具备高效处理长序列等亮点特性。
ChatGPT又突发俩CEO了?纯属扯淡,根本啥大洗牌
The Verge报道,前Meta高管Fidji Simo将以应用线CEO身份接手ChatGPT等业务。这并非大洗牌,而是OpenAI强化产品端能力的举措。此次调整像架构重构,还可能带来商业化变化,也被视为IPO预备动作。
Gemini再揽金牌,力压大学学霸,AI数学推理时代来了!
苏黎世联邦理工学院博士生在大学生国际数学竞赛(IMC)测试了Gemini三种模式,其表现远高于金牌门槛,远超普通大学生。研究人员还从模型输出提取见解,展现了Gemini在数学推理上的优势,凸显AI数学推理能力日益强大。
类R1训练不再只看结果对错!港中文推出SophiaVL-R1模型
DeepSeek - R1爆火后,类R1结果奖励训练范式引发推理热潮,但仅以结果对错奖励模型有弊端。港中文联合团队发布多模态推理模型SophiaVL - R1,引入‘思考奖励’机制,还用Trust - GRPO算法解决奖励欺骗问题。