「性能测试」共找到 3305 篇相关文章
1/8成本比肩Claude 3.7,Mistral Medium 3来了
“欧洲OpenAI”Mistral AI发布多模态新模型Mistral Medium 3,主打编程和多模态理解,成本仅Claude 3.7的1/8,性能达其90%,API已上线,还推出企业聊天机器人服务,引发网友不同看法。
刚刚,国产AI自己造了AI,全球首例!
面壁智能实现全球首例国产AI造AI,用AI编写预训练框架ForgeTrain,性能超英伟达Megatron,还训练出MiniCPM5 - 1B模型。该模型可作桌宠,小尺寸高智能,还能自定义人格,提供工具链。
Grok最新模型吃上Cursor「加餐」,马斯克:Coding实现巨大改进
马斯克在X上透露,xAI的Grok基础模型V9 - Medium(1.5T)完成训练,预计2 - 3周后发布,训练加入大量Cursor数据。同时,xAI的AI编程代理工具Grok Build进入早期Beta测试阶段。
多模态幻觉的病因「高熵节点」找到了!全基准幻觉率下降
多模态大推理模型的幻觉常出现在生成转折词时,此时模型处于高熵关键节点,易脱离图像证据。研究者提出LEAD,高熵时保留候选推理方向,注入视觉锚点拉回证据,实验显示它能跨领域提升模型性能。
蚂蚁集团扩散大语言模型新突破:超800Token/s,速度与质量兼得
蚂蚁集团将LLaDA更新到2.1,通过引入“草稿 - 编辑”机制,打破扩散模型推理速度与质量的对立僵局。它有极速和质量两种模式,还采用混合训练流程及强化学习,在多基准测试中表现出色。
蚂蚁具身智能明牌了:做大脑,和宇树们错位竞争
蚂蚁灵波开源具身智能基座模型LingBot-VLA,用20000小时真实世界数据训练,解锁最大规模开源真机数据之一。它性能超国际顶尖模型,还指明通用具身智能发展路径,为行业提供全栈解决方案。
社区供稿 | 开源SOTA:阶跃发布端到端语音大模型Step-Audio 2 mini!
阶跃星辰发布最强开源端到端语音大模型 Step - Audio 2 mini,在多个国际基准测试集获 SOTA 成绩。它统一建模语音理解等,率先支持语音原生 Tool Calling 能力,架构创新,案例展示其多方面强大能力。
被曝蒸馏DeepSeek还造假!欧版OpenAI塌房了
被誉为欧洲版OpenAI的Mistral被离职员工爆料多项黑幕,其最新模型疑似直接蒸馏自DeepSeek,却包装成RL成功案例,歪曲基准测试结果。此前就有人发现其模型与DeepSeek相似,目前官方暂无回应。
Anthropic刚刚宣布Claude Sonnet 4支持100万token上下文窗口
Anthropic官方公告,Claude Sonnet 4上下文窗口扩大到100万tokens,是之前5倍。能一次读懂大代码库或多篇论文,可用于代码分析、文档处理等。超20万tokens价格翻倍,现仅对Tier 4用户测试。
用Claude Code搭建工作流
作者原本考虑用n8n搭建工作流,现认为Claude Code的Sub - agents和自定义命令功能搭配MCP工具可满足需求。通过示例演示其工作流搭建,还测试换Kimi K2模型,显示其质量更好。