「视觉基准测试」共找到 2557 篇相关文章
全球首款AI原生游戏引擎再进化:GTA6再不来,我们就AI一个
GTA 6跳票成梗,其场景常被用于研究。一个多月前全球首个AI原生UGC游戏引擎发布,如今Mirage迭代为更强大的Mirage 2,支持多样场景,与Genie 3有不同优势且已上线,不过仍有技术问题待解决。
AutoGLM 2.0 深度解析:云端智能体的技术跃进与现实挑战
2025 年 GUI Agent 赛道升温,多数产品依赖本地执行。智谱 AI 在 8 月 AutoGLM 2.0 闭门交流会上展示新路径,其由国产模型驱动,具多能力,在 Agent 云端执行架构、训练方式等方面有突破,也面临一些挑战。
ShellAgent 2.0 体验:让前端消失,省掉 70% 开发资源
本文介绍Myshell ShellAgent 2.0测试情况,它仅用提示词就能生成Agent应用,摆脱前端构建流程,降低创建门槛。文中展示创建计算八字、分析钱包资产、拆解学习资料等应用案例,还能Remix他人发布的应用。
95后北大校友挑起ChatGPT Agent大梁!今年刚博士毕业,曾获陶哲轩支持的AIMO第二名
OpenAI发布ChatGPT Agent项目,奥特曼重视有加,让两个华人挑大梁。孙之清从技术介绍强化学习训练,Casey Chu谈人类与Agent合作。孙之清是95后北大校友,Casey Chu领导过GPT - 4视觉输入原型开发。
超越O4-mini,多模态大模型终于学会回头「看」:中科院自动化所提出GThinker模型
现有多模态大模型在通用场景推理有瓶颈,缺乏对视觉线索校验与再思考能力。中科院自动化所提出GThinker模型,有创新的「线索引导式反思」模式,经两阶段训练,性能超O4 - mini,论文等已开源。
7B模型“情商”比肩GPT-4o,腾讯突破开放域RL难题,得分直翻5倍
腾讯混元AI数字人团队提出RLVER框架,解决开放域RL在真实交互中的‘情商’优化困境。经其训练的Qwen2.5 - 7B模型在情感对话基准得分跃升,比肩顶级商用模型,团队还有诸多启发性发现。
OpenAI员工爆料:已抢先体验GPT-5!7月上线,疑似完全多模态
新智元报道,X上神秘爆料与网友灰度测试经历让GPT - 5讨论再升温。奥特曼称今年夏天可能推出,迈向完全多模态。此外,还提及OpenAI核心团队动态、出走高管新动作及AI发展风险与监管建议。
员工每天花1000美元也要用ClaudeCode!创始人:太贵了,大公司专属,但它比 Cursor 猛!
Claude Code处理大型代码库能力强,但价格贵,有用户称能力超Cursor。其创始人分享设计理念、使用方法等,还提到它基于Claude 4系列模型有新变化,可在GitHub等场景用,未来会拓展工具协同和小任务处理。
“甲方快乐模型”诞生,拿下平面设计新SOTA!多条件一键生成,还能独立调整元素 | 复旦&字节
复旦大学和字节跳动团队联合提出CreatiDesign新模型,可实现高精度、多模态、可编辑的AI图形设计生成。它解决了以往方法在处理图形设计时的难题,在多维度评估基准上表现出色,还支持多轮编辑。
一招缓解LLM偏科!调整训练集组成,“秘方”在此 | 上交大&上海AI Lab等
上海交大和上海AI Lab联合团队提出IDEAL方法,可提升LLM综合性能。研究发现SFT阶段数据数量非关键,配比不当会加剧模型“偏科”。以Llama3.1 8B测试,IDEAL能提升代码能力,还指导了超参数选取。