「GLM-4.5v」共找到 2985 篇相关文章
谁是最强“打工AI”?OpenAI亲自测试,结果第一不是自己
OpenAI发布新研究,提出GDPval基准衡量AI模型在有经济价值任务上的表现。Claude Opus 4.1表现最佳,GPT - 5次之。OpenAI开源优质子集并提供自动评分服务,还指出了GDPval的局限。
80%到25%逆转!大模型代码能力最新排名:Anthropic不再是唯一的神?
OpenRouter网站有模型使用排行榜,按不同使用场景分类。2024年12月到2025年2月,Anthropic模型编程流量占比曾达80%,后谷歌Gemini 2.5 Pro等抢占份额,其跌至25%以下,Claude 4发布后份额回升。还介绍了OpenRouter特点。
协同加速,多机器人协作不再「慢半拍」!软硬一体化框架ReCA破解具身智能落地效率瓶颈
佐治亚理工学院等团队推出集成加速框架 ReCA,针对多机协作具身系统,从算法、系统、硬件跨层协同优化,经评估,实现 5 - 10 倍速度提升且成功率升 4.3%,为具身智能落地奠基。
刚刚,霸榜神秘视频模型身份揭晓,原来它就是「David」
几天前登上Artificial Analysis榜首的神秘视频模型揭晓,是Runway最新发布的Gen - 4.5。它树立行业新标杆,在多方面表现出色,但也存在一些视频模型常见的局限性,Runway正探索解决办法。
陶哲轩惊叹!数学奇点初现,AI首次给出人类无法企及的原创证明
谷歌DeepMind团队用Gemini证明代数几何新定理,获斯坦福教授认可;Grok 4.20解决Bellman函数难题;GPT 5.2处理高阶数学问题能力惊人。陶哲轩预言AI或独自攻克部分埃尔德什问题,2026年或成「ASI元年」。
央企牵头!这个AI开源社区要让大模型跑遍「中国芯」
6月30日百度文心大模型4.5系列开源并登陆魔乐社区,该社区发起‘模型推理适配协作计划’,想让大模型跑遍中国芯。其升级工具中心和协作空间,联动产业力量,解决模型在国产芯适配难题,推动生态发展。
AI 精神病的巅峰:Claude Mythos 和 OpenAI Spud 还没上线,就有人度假都睡不着了
还未发布的Claude Mythos和OpenAI Spud在舆论场引发热议,大众情绪被拉高。OpenAI推出GPT - 5.4 - Cyber,还跟进‘安全’故事。网友对‘模型太危险只能少数公司用’说法存疑,同时GPT - 6等新模型消息不断。
Hexstrike AI在多个工具及模型上的渗透测试表现
文章围绕Hexstrike AI在多个工具及模型上的渗透测试展开。介绍测试环境,用不同难度靶机测试。分析Claude desktop+Sonnet 4.5、AIaW+Deepseek、Cursor+多个模型等组合表现,指出LLM辅助渗透测试任重道远。
用户痛点发现器
用户痛点发现器是个Web应用,能从社交媒体自动发现用户核心痛点,支持聚类分析和AI产品方案生成。它可输入关键词抓取抖音视频和评论,用GLM-4.6模型分析,还有优先级评分等系统。
智谱公布“降智”的秘密:Scaling不可避免的痛
智谱最新技术博客大倒苦水,称从GLM - 5以来遭遇「Scaling Pain」。团队排查出高负载下推理状态管理等问题致异常,还给出避坑指南,如在线异常监控策略,优化后系统更稳定,吞吐量提升。