「大模型评测」共找到 9435 篇相关文章
再见Bug!谷歌超级编码智能体Jules上线,免费使用直连GitHub
谷歌推出编程智能体Jules,进入全球测试阶段,有Google账户的开发者可免费试用每日5次。它基于Gemini 2.5 Pro模型,能写代码、修Bug等,还可连GitHub简化流程,预计今年晚些时候推更多功能和企业版。
macOS Harness:AI 自己写代码,操作你的整台 Mac
macOS Harness 是 browser - use 团队开源项目,目标是让 LLM 用持久化 Python 进程完成 Mac 上几乎所有任务。它仅提供六个原始操作,模型用其操作应用,还能在运行中补全缺失部分。项目有诸多优势,目前仅支持 macOS。
永别了,Sora!奥特曼All in超级App
OpenAI一早关停爆火仅6个月的AI视频APP Sora,包括其开发者版本及ChatGPT内视频功能。奥特曼此举是为打造「超级应用」、为IPO铺路,同时为新模型Spud腾出算力,其预训练已完成,将在未来几周发布。
人脑细胞做成芯片打Doom!20万活体神经元自己探路杀敌,学习效率碾压深度强化学习
20万人类脑细胞组成“脑PU”学会玩《毁灭战士》,代码已开源。研究将活体神经元与三大强化学习算法对比,发现生物培养物学习效率全面超越算法。实验运行在Cortical Labs的CL1生物计算机上,团队邀开发者探索更多可能。
国产具身智能创全球新纪录!以30%成本跑赢 Figure AI 45%效率,聪明的具身大脑成关键
自变量机器人在「夹爪方案挑战1248件/小时物流分拣」直播中,以双机械臂+夹爪方案,成本降70%,分拣效率提超45%,准确率达98%。其依托WALL - B模型,展现出强大泛化能力,探索出具身智能新路径。
倒卖英伟达GPU算力比火箭卫星来钱快!马斯克交出SpaceX首份财报
SpaceX交出首份上市后财报,AI业务收入25.61亿美元同比猛增247%,成第二大收入源。不过AI业务支出158.28亿美元是烧钱大头,业务仍亏损,未来盈利面临客户消化力等问题。
统治AI十年的Transformer,要被亲爹亲手砸碎?
5月5日旧金山的辩论赛上,Transformer联合发明人Łukasz Kaiser为其作品辩护,三位挑战者指出Transformer五大死穴。Kaiser称除非新架构证明有更好的scaling曲线,否则Transformer仍是主流,还给出具体辩护。
RAG外部检索是多余的,英伟达最新成果颠覆认知
英伟达INTRA论文指出RAG架构中检索器和生成器在不同表示空间工作,存在retriever - generator mismatch问题。INTRA让模型用注意力查询检索自身编码表示,训练量小,在多跳QA上超越多种检索基线。
GitHub Trending 榜一的开源 Cowork 来了!4天4.5K星,首个多智能体工作流应用!
开源项目Eigent冲上GitHub Trending榜首,4天获4.5K+ Star。它是全球首个多智能体工作流桌面应用,完全开源、支持本地模型,有多种智能体工作流,具备本地优先、并行工作流等特性,提供三种使用模式。
把 AI Coding Agent 搬进终端:Crush 让你的命令行变成“编程搭子”
Crush是Charmbracelet出品的终端AI编程代理,可将工具、代码和工作流接到所选LLM,在终端协同工作。它有多模型、会话制等特点,适合终端重度用户等,还介绍了安装、使用及进阶玩法。