「性能评测」共找到 2473 篇相关文章
千问3:开源第一不只是说说!
英伟达新开源的OpenCodeReasoning系列选千问作基础底座。千问3以Apache 2.0发布后,开发者生态更新频繁,衍生模型超10万,下载量破3亿,全球第一。其性能强,正加速开启全栈式AI时代。
AI 视频生成的未来在中国
当地时间3月24日,OpenAI宣布关闭视频生成应用Sora,这是其冲刺IPO前的战略调整。Sora曾是AI视频生成领域明星产品,性能卓越,但因内容生态缺失、商业变现难而关停。中国AI视频生成赛道崛起,应用场景丰富,形成生态壁垒。
14B打败671B!微软rStar2-Agent在数学推理上超过DeepSeek-R1
如今的大语言模型推理能力关键在于测试时扩展,但长思维链有局限。微软研究团队用主动式强化学习探索,成果 rStar2 - Agent 方法训练出 14B 的 rStar2 - Agent - 14B 模型,性能超 671B 的 DeepSeek - R1。
把事实核查嵌入诊疗流程:MedGuard给「诊疗安全」当守门人
蚂蚁AI安全实验室与厦门大学团队联合提出MedGuard,将医学事实核查嵌入诊疗流程。它是医疗安全基础设施,在诊疗意见等形成前验证事实,在评测和临床评价中表现突出,能准确判断风险边界,可嵌入医疗流程。
告别「边画边说」:LatentMorph 开启视觉生成隐式潜空间推理新范式
现有的文生图模型缺乏动态思考与自我修正能力,香港科技大学团队提出LatentMorph框架,将隐式潜空间推理集成到T2I生成过程中,实验显示其显著提升基座模型性能,削减推理延时与Token消耗,实现人机认知对齐。
百川开源医疗大模型 M3,王小川:今年会发布两款 ToC 产品,正在做硬件
1月初OpenAI、Anthropic推出医疗产品,百川智能也开源医疗大模型Baichuan - M3,评测成绩突出。王小川表示今年会发布两款ToC产品,还在做硬件,阐述了百川在医疗领域的目标与策略。
钉钉不说话,默默把 AI 表格干到了 1000 万热行
钉钉 AI 表格单表容量突破 1000 万热行,成业内首个实现该能力的智能表格。它基于阿里 AI 技术重构底层架构,实现性能与智能融合,在业务场景应用效果好,推动 AI 办公进入‘原生时代’。
LangChain联合Manus季逸超最新分享!也许当前最好的「上下文工程」讲解
文章由LangChain创始工程师与Manus联合创始人深入探讨上下文工程,介绍其兴起背景、重要策略。指出AI Agents上下文膨胀致性能下降,上下文工程能解决此问题,还阐述了避免模型专业化陷阱及相关实战经验等内容。
苹果港大终结自回归时代?7B扩散模型发布,AI写代码逻辑彻底颠覆!
苹果联合港大开源扩散大语言模型DiffuCoder,用扩散模型+强化学习策略,性能提升4.4%。研究还提出耦合梯度奖励策略优化方法,建立原生RL训练框架,探究了dLLM的生成机制等问题。
图像界的DeepSeek!12B参数对标GPT-4o,5秒出图,消费级硬件就能玩转编辑生成
Black Forest Labs开源旗舰图像模型FLUX.1 Kontext[dev],专为图像编辑打造,能在消费级芯片运行。12B参数少、推理快,性能媲美闭源模型。有诸多特点,经优化训练,在KontextBench基准表现优。