无门控测试」共找到 2271 篇相关文章

新闻资讯7

谷歌推出 Jules:一款基于 Gemini 2.5 的异步编程智能体

谷歌将异步智能编程助手 Jules 正式发布,它基于 Gemini 2.5 Pro 模型,可执行多种编程活动。采用异步模式,直接接入代码库。测试阶段开发者反馈多,正式版有三种访问层级,但部分用户对其界面和输出质量不满。

InfoQ
新闻资讯7

刚刚,LMArena最新模型榜单出炉!DeepSeek-R1网页编程能力赶超了Claude Opus 4

LMArena最新模型榜单出炉,DeepSeek - R1(0528)表现亮眼。在文本基准测试中整体排第6、开放模型中排第一,细分领域也成绩优异,在WebDev Arena平台与闭源大模型并列第一,超Claude Opus 4。

机器之心
新闻资讯8

Qwen3.8-Max 正式版终于发布了,能不能打过 GPT 看这里

Qwen 3.8 Max 正式发布,沿用 Qwen 3.5 架构,参数量扩展,重点提升 Coding、Work 和 Agent 能力。它将开放权重,价格有优势。在多项测试中表现出色,还新增多模态能力,已可使用并有优惠。

MacTalk
产品应用8

审美在线、随叫随到、月薪19刀——Lovart把AI设计师这件事做认真了

Lovart适合设计预算的人,将专业设计师装进AI工具。其Brand Kit解决风格不稳定问题,Font Generator可生成专属字体,Create Skill能固化学习成本,还有Export PSD、Mock Up等实用功能,月费仅19美元。

AI寒武纪
算法论文8

一个问题几百美元,DeepMind智能体一次搞定了9个Erdős问题

DeepMind团队的大模型在一次‘测试’中解决9个开放的Erdős问题,还自动验证,解法通过人工审查。其框架AlphaProof Nexus结合大模型与Lean编译器,研究展示了AI辅助正式证明搜索技术潜力。

机器之心
算法论文8

ICML 2026 | 拒绝盲目猜token,阿里x浙大将投机解码带入弹性预算时代

随着大模型参数规模扩大,推理成本成核心瓶颈。投机解码在高并发下有问题,阿里与浙大学者提出 ECHO,将投机树构造建模为预算调度问题,通过稀疏门控和弹性预算调度提升系统收益。

机器之心
算法论文8

机器人终于「懂」家务了!伯克利MomaGraph让机器人像人一样做家务

过去家用机器人做家务存在诸多难题,最近加州伯克利和马里兰大学联手推出 MomaGraph 技术。该技术采用「Graph - then - Plan」思路,团队搭建了完整体系,在星动 Q5 上测试效果好,让家用服务机器人迈向实用。

机器之心
开源动态7

深度拆解:如何在 LangChain DeepAgents 中复现 Claude 的 Skills 机制 ?

本文探讨在LangChain的DeepAgents框架复现Claude的Skills机制。先回顾Skills,它是Anthropic提出的Agent能力注入方式,有渐进式加载特点。接着介绍让通用框架支持Skills的环节,最后测试验证其效果和收益。

AI大模型应用实践
算法论文8

VAE再被补刀!清华快手SVG扩散模型亮相,训练提效6200%,生成提速3500%

前脚谢赛宁宣告VAE在图像生成领域退役,后脚清华与快手可灵团队就推出VAE潜在扩散模型SVG。它通过语义+细节双分支+分布对齐,实现多任务通用,训练提效62倍、生成提速35倍。

量子位
产品应用8

Claude官方即将推出Chrome浏览器插件,可能....其它所有的AI浏览器插件都会死。

Claude官方即将推出Chrome浏览器插件,现正进行小范围测试。它功能强大,能在侧边栏操作页面,还能处理日程、邮件等工作。相比多数插件,它安全性高,或让仅能总结摘要的插件被淘汰。

开源AI项目落地