「MiniCPM - o 4.5」共找到 3107 篇相关文章
Claude 通过率不到 4%,SaaS-Bench 撕碎了 Computer-Use 的「全自动办公」幻想
UniPat AI用SaaS - Bench测试,让Agent在真实工作环境中执行任务。结果显示,Claude Opus 4.7端到端完全通过分数仅3.8%,多数模型表现差,还暴露Agent四种致命缺陷,揭示其与真实工作能力有巨大鸿沟。
一个模型统一4D世界生成与重建,港科大One4D框架来了
港科大研究团队提出 One4D 框架,可统一 4D 生成与重建,构造同步输出多模态的视频扩散模型,支持多种任务形态。其有 DLC、UMC 等亮点,用合成与真实数据混合策略训练,实验表现佳。
奥特曼:感受不到GPT-5变强,是因为你还不够「专业」
GPT-5发布后口碑不佳,直播事故、网友吐槽、专家唱衰不断,有人喊出‘AI第二次寒冬要来了’。但奥特曼认为这是节奏和期待错位,GPT-5在科研等高阶领域有提升,技术范式也有转变,且OpenAI仍看重规模。
全网挤爆Seedance 2.5,但2.0 fast降到6毛是真的香!
近期AI视频赛道竞争激烈,FLUX 3登场,国内巨头也纷纷推出新模型。字节Seedance 2.5优势明显,但适用特定场景。Seedance 2.0 fast降至6毛每秒,经多场景实测,表现均衡,是性价比之选。
Cursor发布Composer 2:专攻代码的模型,价格只有GPT-5的零头
Cursor本周发布自研编程模型Composer 2,只攻代码生成。其得分提升,超Claude Opus 4.6,接近GPT - 5.4 Thinking。训练基于代码数据,处理复杂编程任务准确度高,价格远低于竞品。这是Cursor全栈布局,欲掌握AI编程主动权。
GPT-5通过“哥德尔测试”!独创性解决博士生都得花几天时间的开放数学问题
最新论文中,研究人员让GPT - 5挑战5个未解决的优化猜想,它解出3个,还对一题给出不同有效证明方案。测试题需博士水平研究者花几天完成,研究还“挑衅”了陶哲轩对大模型数学能力的印象。
Grok 4作战图刷爆全网,80%华人横扫硅谷!清华上交校友领衔,95后站C位
Grok 4一夜爆火硅谷,一张内部作战图显示其幕后团队华人学者占比达80%,包括Jimmy Ba、吴怀宇等。独立评测中Grok 4成绩优异,但也有人质疑其代码基准结果有过拟合嫌疑。
跳出英伟达生态:OpenAI 发布新编程模型 GPT-5.3-Codex-Spark,速度达 1000 token每秒
OpenAI 发布新编程模型 GPT-5.3-Codex-Spark,跑在 Cerebras 晶圆级芯片上,速度达每秒超 1000 个 token,比传统 GPU 推理快约 15 倍,这是其跳出英伟达生态的里程碑。
Lovable 一个月新增 1 亿美金 ARR,Replit 再融 4 亿美金 Cursor 打算融 50 亿美金
今年AI Coding赛道增长疯狂且用户付费意愿强。Lovable ARR突破4亿美金且增速加快,年底或破10亿;Replit官宣新一轮融资,推出Agent 4;Cursor拟融50亿美金,其CEO称AI软件开发进入新阶段。
实测GPT-5 Pro:别被普通版骗了!Pro才是OpenAI真正的顶级模型
新智元实测发现GPT-5表现飘忽,但其Pro版本实力强劲。在编程、推理计算、图像识别等多方面表现出色,网友实测后也赞不绝口。此外,文中还介绍了GPT-5提示指南及OpenAI放出旧模型的彩蛋。