「编程基准测试」共找到 2950 篇相关文章
从显式CoT到隐式CoT:复旦让AI告别啰嗦,实现大模型高效沉默推理
复旦大学等机构团队论文提出SIM - CoT技术,解决隐式思维链推理准确率低、不稳定问题。该技术引入步骤级监督,提升性能、效率和可解释性,在多模型和任务测试中表现出色,让大模型高效沉默推理。
9 个加速开发者生产力的开源 AI 与 MCP 项目
Github官方精选9个开源项目,分框架与平台集成、开发者体验及AI增强编码、自动化与测试编排三大主题。各项目聚焦不同功能,如将MCP嵌入框架、语义理解辅助编码、安全执行调试等,能加速开发者生产力。
模型即 Agent 的含金量:Kimi深度研究功能详评
作者分享Kimi深度研究功能体验。其基于端到端自主强化学习技术,会开源模型。在测试中,分析Labubu爆火原因、检索小米发布会内容,展现出强逻辑分析、搜索准确性和数据处理能力,可视化网页也出色。
80%到25%逆转!大模型代码能力最新排名:Anthropic不再是唯一的神?
OpenRouter网站有模型使用排行榜,按不同使用场景分类。2024年12月到2025年2月,Anthropic模型编程流量占比曾达80%,后谷歌Gemini 2.5 Pro等抢占份额,其跌至25%以下,Claude 4发布后份额回升。还介绍了OpenRouter特点。
何恺明新作:给扩散模型加正则化,无需预训练无需数据增强,超简单实现性能提升
何恺明最新论文研究扩散模型与表征学习的联系,提出Dispersive Loss正则化方法。它无需正样本对,有高通用性、低计算开销等优势,在多模型测试中提升了生成质量,在其他任务也有潜力。
为什么又是杭州?杭州初创团队打造全球第一个AI旅行伙伴
杭州初创团队打造的iMeanAI Coyage是全球首个AI旅行伙伴,能解决旅行规划中选择困难和信息过载问题,如订机票、酒店、行程,经测试表现出色,还将开放多语言语音导览功能。
小扎开9位数薪酬新建AI团队!砸千亿收购华人初创公司,Llama 4太拉胯急坏了
Meta CEO扎克伯格对Llama 4表现失望,一边开7 - 9位数薪酬从谷歌、OpenAI等公司挖人组建新AI实验室,另一边豪掷148亿美元收购初创公司Scale AI 49%股份并挖来CEO,Llama 4在第三方测试中表现不佳。
只要9美元!LoRA+强化学习,DeepSeek 1.5B推理性能暴涨20%
南加州大学团队基于LoRA的强化学习训练1.5B推理模型,在AIME 24测试上性能提升超20%,成本仅9美元。开源Tina模型结合三大关键技术,与SOTA模型相比竞争力强,研究者还对其有效性提出假设。
The Batch: 907 | 小而高效模型的“制作”方法
Mistral AI发布Ministral 3系列模型权重,结合剪枝与蒸馏技术,用级联蒸馏法构建。该系列参数规模有140亿、80亿和30亿,在部分测试中表现佳,训练成本低于传统方式。
马斯克急了,直播回应一切!xAI全新阵容首曝光,华人联创仅剩一人
马斯克召开全员大会回应xAI高层变动,官宣合并后全新阵容。他还介绍了xAI四大核心板块,强调其发展成果,提及编程变革,宣布X平台开源等,更规划在月球建AI工厂。