「对赌协议」共找到 2402 篇相关文章
不吹不黑,GPT-5代码能力究竟怎么样?跟 Gemini 和 Claude 的对比测试给你答案
作者测试了 GPT-5 的代码能力,并与 Gemini 和 Claude 对比。在不同代码任务中,各模型表现不同。如在生成网页任务里,GPT-5 部分结果不错,但受 32K 上下文限制,长文本处理不如 Gemini,硬实力也不如 Claude。
砸场GPT-5,马斯克:Grok 5 年底推出!
OpenAI举办GPT - 5发布会,现场状况百出,图表数据与柱状图不符,员工表现不佳。马斯克趁势放话,年底前推出Grok 5且会「碾压性地出色」,还引用数据挑衅,网友对此反应不一。
AI“压力面”,DeepSeek性能暴跌近30% | 清华&上海AI Lab
上海人工智能实验室等团队设计REST框架,在一个prompt里抛多问题模拟复杂推理场景。结果显示,DeepSeek - R1等模型高压下性能大幅缩水,REST能拉开不同模型差距,还揭示评测方法局限。
大模型再爆弱点!旧记忆忘不掉,新记忆分不出,准确率暴降 | ICML'25
弗吉尼亚大学和纽约大学研究人员用「前摄干扰」概念设计测验PI - LLM,测试大语言模型(LLM)上下文检索能力。结果显示,随干扰增加,模型准确率对数下降至零,提示工程效果有限,需调整模型架构或训练范式。
AI编程「反直觉」调研引300万围观!开发者坚信提速20%,实测反慢19%
非营利性 AI 调研机构「METR」对 AI 编程工具影响开发者效率进行随机对照实验,结果意外:开发者本坚信提速 20%,实测却慢 19%。还分析了原因,指出调研局限与未来展望。
研究表明:资深开发者在使用AI工具时,完成任务的时间比不使用时延长了19%。
研究通过随机对照试验,发现2025年初资深开源开发者使用AI工具完成任务时间比不使用时延长19%。当前衡量AI能力多依赖标准化评测,可能高估或低估其真实能力,研究旨在更准确评估。
数学家跨界找到百年难题最优解,能给无线通信领域带来新思路
数学家Boaz Klartag跨界破解高维空间球体堆积难题,用被弃老方法找到最优解,使给定d维空间球体堆积数量扩至先前纪录的d倍,为无线通信领域带来新思路。
研究表明,开源能推动AI创新和经济增长
Siliconangle消息,Linux基金会新研究显示开源对全球经济贡献达9万亿美元。其首席经济学家Frank Nagle指出,AI加入使开源价值评估方式改变,计算开源AI价值复杂,参与开源项目能增加经济价值。
如何做到在手机上实时跑3D真人数字人?MNN-TaoAvatar开源了!
阿里巴巴淘宝Meta技术团队研发的TaoAvatar技术,能在手机或XR设备实现3D数字人实时渲染与AI对话。今日开源MNN - TaoAvatar应用,可在手机运行,对比主流方案更高效便捷,还介绍其优势、技术及使用说明。
DPO与GRPO谁更胜一筹?港中文、北大等联合发布首个系统性对比研究
港中文、北大等团队首次全面对比DPO和GRPO算法在自回归图像生成中的应用,评估其在域内、域外性能,探究奖励模型及扩展策略的影响,为开发高效RL算法提供新思路。