AFIM基准测试」共找到 2050 篇相关文章

开源动态8

NVIDIA重磅开源!OmniVinci 仅 9B 模型就拿下多模态冠军!

英伟达推出全模态大语言模型 OmniVinci,架构有三大创新。OmniVinci - 9B 模型表现亮眼,多测试中大幅超 Qwen2.5 - Omni,且训练量仅为其六分之一。其架构经多阶段流程实现全模态理解,还支持多种功能。

带你学AI
产品应用7

老黄亲自站台,英伟达编程神器!Cursor 2.0自研模型狂飙4倍

Cursor 2.0版本重大升级,发布自研编码模型Composer,速度是同等模型4倍。还重构IDE交互逻辑,支持多智能体模式,引入语音模式等。早期测试和开发者反馈其速度快,但智能程度与部分模型有差距。

新智元
算法论文8

Codeforces难题不够刷?谢赛宁等造了个AI出题机,能生成原创编程题

LiveCodeBench Pro团队推出AutoCode框架,利用LLM自动化竞赛编程问题创建与评估。该框架结合验证器 - 生成器 - 检查器框架与双重验证协议,在测试用例生成上可靠性佳,还能生成新问题,同时揭示了LLM在创作上的优劣势。

机器之心
开源动态8

阿里智能体多轮推理超越GPT-4o,开源模型也能做Deep Research

通义实验室推出自主信息检索智能体WebDancer,其通过系统化训练范式为构建智能体提供路径,也为在开源模型上复现Deep Research系统提供指导。它在多数据集测试中表现出色,团队还对其未来应用做了展望。

量子位
开源动态8

机器人进入“边做边学”时代:星尘发布在线强化学习框架,让动态投掷成功率提升超141%

星尘智能基座模型团队公布在线强化学习框架SmoothRL,解决异步执行环境中具身模型在线微调难题。该框架让策略更新对应硬件实际执行,攻克延迟失准问题,在多项真机测试中大幅提升任务成功率。

AI前线
新闻资讯8

一个「流浪」数学家的遗产,正在被AI公司疯抢

2026年,OpenAI等公司用AI解决多个匈牙利数学家Paul Erdős提出的问题,震动数学界。这些问题分布广、难度跨度大,适合模型测试。不过,AI证明的验证和人类数学家地位受关注。

机器之心
新闻资讯7

提前实测Opus 5:3D细节封神,然而有一个致命缺陷

全网苦等Opus 5,结果其暂缓发布,理由是怕威胁人类对高级AI的控制,遭网友怒批。部分开发者提前实测,它3D细节表现出色,但耗token且看图测试翻车,原定有诸多强大特性。

新智元
算法论文8

谢赛宁盛赞字节Seed新研究!单Transformer搞定任意视图3D重建

字节Seed康炳易团队的最新研究成果Depth Anything 3(DA3),获谢赛宁盛赞。它架构简单,能从多种输入中精准算出物体深度、还原相机位置,在新视觉几何基准上表现出色,核心秘诀是极简设计。

量子位
产品应用8

可灵2.5Turbo实测|顶尖AI视频模型,真能打平CG吗?

可灵发布2.5 Turbo版本视频模型,进步显著,提示词理解、高速动态表现、风格稳定性都有提升,价格还更划算。经多场景测试,其在特定场景下内容质量能与CG媲美,开始理解动作背后逻辑。

歸藏的AI工具箱
产品应用8

谷歌发布Nano Banana官方保姆级开发教程,代码给你喂到嘴边

谷歌为Nano Banana新模型发布官方保姆级开发教程。介绍了使用Google AI Studio免费测试方法,阐述环境准备,如获取API key、设置结算账户、安装Gen AI SDK,还展示代码实战,以及和模型沟通的技巧。

AIGC开放社区