「测评榜单」共找到 761 篇相关文章
Vibe Coding杀进3D领域!OpenAI总裁都在围观这种新玩法
AI 3D 基础模型领先公司 VAST 发布 Tripo P2.0,直接产出原生四边面拓扑,解决生成后模型可用性问题。此外,VAST 完成约 30 亿融资,Tripo 系列在评测中居首。
落地商用开启国产一体化智算新时代,蓝芯算力LX500亮相滴水湖RISC-V产业论坛
2026年8月13日,第五届滴水湖中国RISC - V产业论坛召开。蓝芯算力生态营销负责人许庆伟以核心产品LX500为线索,从架构、算力、商业落地三方面,展示国产RISC - V算力商用路径。
DeepSeek-V4-Flash正式版发布并开源,全面超越V4-Pro预览版
DeepSeek-V4-Flash正式版发布并开源,这一304B轻量级模型经后训练,性能远超V4-Pro预览版,与Claude Opus-4.8接近。模型权重开源后上Huggingface趋势榜第二,性价比高,实测表现佳。
Claude Code终于长出调度台:一个屏幕盯住所有AI会话,无需多开
Anthropic为Claude Code上线Agent视图研究预览版,提供「指挥中心」,可在一个界面管理所有会话。开发者能启动多个AI智能体并行处理任务,一目了然掌握任务状态,还支持在线回复和任务切换。
神秘模型排名超 Gemma 4 31B:不跟 Qwen 硬刚,主打“快”和“省 token”
OpenRouter的Elephant模型Trending榜排名超Gemma 4 31B。它是100B参数隐身模型,主打‘智能效率’,在速度、token消耗、指令遵循等方面与其他100B级别模型对比各有优劣,代表极致轻量路线。
永别了,背公式时代!波兰物理学家用一个算子统一数学
2026年4月,波兰雅盖隆大学物理学家安杰伊·奥德尔齐沃莱克发表论文,提出算子eml(x,y) = eˣ − ln(y),证明不断嵌套此算子可推导出科学计算器上每个按键对应的函数,引发数学界震动。
13 万人收藏的 Openclaw 登顶GitHub No.1!附上超绝性价比部署指南!(保姆级)
Openclaw在GitHub上Star数近13万,登上多榜单TOP1。作者介绍用GitHub Codespaces零成本搭建其服务,搭配Kimi K2.5模型和Discord应用,还给出部署步骤、常见问题解决办法及功能演示。
刚刚,Cursor又分享了数百Agent并发协作的最佳实践
Cursor分享数百Agent并发协作最佳实践,讲述单个Agent局限,介绍从多方面探索协同方法,如规划者与执行者分工,还展示多个实验成果,总结模型选择等经验,指出多智能体协同仍待优化。
中美算力,站在2000亿美元的分岔路口
高盛报告称2025年全球人工智能投资规模或接近2000亿美元。中美算力发展站在分岔路,中国追性能,美国被能源限制。全球算力市场有新变化,中国本土芯片崛起,各方也在热议AI是否有泡沫。
空间智能终极挑战MMSI-Video-Bench来了,顶级大模型全军覆没
上海人工智能实验室 InternRobotics 团队推出空间智能视频基准 MMSI-Video-Bench,对主流多模态大模型进行评测。该基准题型全面、问题具挑战性,视频数据多样,能针对性测评。结果显示模型与人类差距显著,明确了能力瓶颈。