大模型测试」共找到 9665 篇相关文章

新闻资讯7

Meta亿元天团首个模型交卷!余家辉宋飏Jason Wei耗时九个月,一雪Llama前耻

Meta超级智能实验室耗时9个月推出原生多模态模型Muse Spark,发布后股价拉升。它让Meta在第三方测评中赶上第一梯队,虽在编程和长时间自主运行有差距,但在多模态理解等方面表现突出,不过也有编程翻车情况。

量子位
新闻资讯7

Grok最新模型吃上Cursor「加餐」,马斯克:Coding实现巨改进

马斯克在X上透露,xAI的Grok基础模型V9 - Medium(1.5T)完成训练,预计2 - 3周后发布,训练加入量Cursor数据。同时,xAI的AI编程代理工具Grok Build进入早期Beta测试阶段。

量子位
新闻资讯7

Anthropic发最高警告:0day爆发即将来临!全球巨头瞬间蒸发数十亿

Anthropic发布新模型预览版Claude Mythos Preview,它在测试中表现惊人,致网络安全巨头Cloudflare股价暴跌。这动摇了SaaS帝国根基,Anthropic启动计划发布生存指南,却遭顶级黑客质疑。

新智元
新闻资讯7

Gemini再揽金牌,力压学学霸,AI数学推理时代来了!

苏黎世联邦理工学院博士生在学生国际数学竞赛(IMC)测试了Gemini三种模式,其表现远高于金牌门槛,远超普通学生。研究人员还从模型输出提取见解,展现了Gemini在数学推理上的优势,凸显AI数学推理能力日益强

新智元
新闻资讯7

人民想念DeepSeek

文章探讨AI时代Token相关问题。指出其消耗、价格贵,存储价格上涨使Token降价缺杠杆,虽模型能力提升、MFU优化可降本,但传导到C端取决于商业考量。还回顾模型价格战,介绍本地部署及芯片创新方案。

芯师爷
产品应用7

10万智能体同场模拟,YuLan-OneSim带来真正的社会实验

YuLan-OneSim是语言模型驱动的社会模拟器,能模拟人类社会行为。它可零代码构建场景,有50个默认场景,具分布式架构,支持10万智能体同场模拟,还推出AI社会研究员,自动完成社会科学研究流程。

带你学AI
开源动态8

迈向AI4S 2.0,上海AI实验室开源书生万亿科学模型Intern-S1-Pro

2月4日上海人工智能实验室开源万亿参数科学多模态模型Intern - S1 - Pro,为AI4S迈向2.0提供开源基座。其核心科学能力跃升,底层架构创新,科学与通用能力协同发展,还构建了‘算力 - 算法’一体化基座,推动科研范式革命。

OpenMMLab
算法论文8

推理与操控能力双提升!具身机器人双系统VLA模型新突破

香港中文学等联合提出Fast - in - Slow(FiS - VLA)统一双系统VLA模型,实现快慢系统融合。在真机和仿真测试中,成功率和控制频率提升显著,泛化能力强。未来计划探索动态调参机制。

量子位
开源动态8

Karpathy强推,厂抢着「复古」命令行,Star数全都上千了

飞书、钉钉、企业微信接连推出 CLI,GitHub Star 数上千。CLI 是传统人机交互方式,契合语言模型运作逻辑,国内外多家公司及项目推出相关工具,还给出为智能体构建 CLI 的设计模式。

机器之心
开源动态8

万帧实时!流式3D重建天花板,被国产开源模型打破了

蚂蚁正式开源 LingBot-Map,这是基于几何上下文 Transformer 的纯自回归流式 3D 重建基础模型。它能在恒定内存下实现超万帧长视频实时三维重建,处理速度约 20 FPS,在多基准测试中超越现有流式方法。

机器之心