测试时微调」共找到 2499 篇相关文章

开源动态7

代季峰陈天桥联手AGI首秀炸场!最强开源深度研究模型,GAIA测试82.4分超OpenAI

MiroMind ODR是代季峰加盟陈天桥后的技术首秀,GAIA测试82.4分超OpenAI。它全开源可复现,包括MiroFlow、MiroThinker等四个子项目。团队还曾推出MiroMind - M1,专注提升数学推理能力。

量子位
算法论文8

68页论文再锤大模型竞技场!Llama4发布前私下测试27个版本,只取最佳成绩

《排行榜幻觉》论文指出Chatbot Arena存在问题,如少数大厂私下多版本测试选最优、数据访问不平等、用Arena数据训练可提性能、模型被大量静默弃用等,研究团队给出改进建议,官方也进行了回应。

量子位
产品应用7

不吹不黑,GPT-5代码能力究竟怎么样?跟 Gemini 和 Claude 的对比测试给你答案

作者测试了 GPT-5 的代码能力,并与 Gemini 和 Claude 对比。在不同代码任务中,各模型表现不同。如在生成网页任务里,GPT-5 部分结果不错,但受 32K 上下文限制,长文本处理不如 Gemini,硬实力也不如 Claude。

歸藏的AI工具箱
算法论文8

超越GPT-4o!华人团队新框架让Qwen跨领域推理提升10%,刷新12项基准测试

加拿大滑铁卢大学与TikTok新加坡的华人团队提出全新训练框架General - Reasoner,让Qwen系列大模型跨领域推理准确率提升近10%,在多项基准测试中超越GPT - 4o。该框架有全领域推理数据集和生成式答案验证器两大创新。

量子位
算法论文8

突破一亿Token极限:EverMind提出MSA架构,实现大模型高效端到端长记忆

机器之心发布文章介绍,大模型长期记忆能力受限于上下文长度。《MSA: Memory Sparse Attention for Efficient End-to-End Memory Model Scaling to 100M Tokens》提出MSA架构,突破扩展性、精度和效率的不可能三角,实现100M长度的大模型长记忆框架。

机器之心
开源动态8

视觉语言模型“扫地僧”:360低调开源FG-CLIP2登顶29项全球基准测试 | 甲子光年

两周前,360人工智能研究院低调开源FG - CLIP2,它在29个公开基准测试中超越Google和Meta的模型。该模型实现局部细粒度识别和原生双语对齐,为AI视觉理解设新基准,已服务开发者并在多领域落地。

甲子光年
算法论文8

告别微调代:拖拽式LLMs实现12000倍加速适配,输入描述,秒级定制LLM,效果、速度全面超越

传统高效微调技术成大规模部署瓶颈,论文提出Drag-and-Drop LLMs (DnD),仅需输入目标任务未标注提示,即可秒级生成适配的LoRA权重,实现LLM秒级免训练适配,效率、性能和泛化性上均有突破。

深度学习自然语言处理
推荐文章8

骂谷歌干蠢事、炮轰甲骨文、AI在真实数据库测试得分为0!83岁图灵奖数据库教父的硅谷“狂人日记”

本文是对图灵奖得主、Postgres 奠基者 Mike Stonebraker 的访谈。他直言大模型 Text - to - SQL 在真实数据库测试得分低,批评谷歌、甲骨文等公司做法,还探讨数据库未来,如 Agent 读写与数据库结合、DBOS 技术等。

AI科技大本营
开源动态8

字节Seed团队发布Seed1.5-VL,用仅20B活跃参数在60个主流测试中狂揽38项第一!

字节Seed团队发布Seed1.5-VL,仅200亿活跃参数就在60个主流测试中获38项第一。介绍其架构、预训练、后训练等情况,评估表现出色,虽处理复杂场景有局限,但仍在多模态任务取得显著进展。

深度学习自然语言处理
开源动态8

阿里开源14B电影级视频模型!实测来了:免费可玩,单次生成长可达分钟级

昨夜阿里发布14B视频模型Wan2.2 - S2V,仅需一张图片和一段音频,就能生成电影级数字人视频。该模型发布即开源,可在通义万相官网免费体验,单次生成长可达分钟级。

量子位