功能测试」共找到 3128 篇相关文章

新闻资讯7

谷歌推出 Jules:一款基于 Gemini 2.5 的异步编程智能体

谷歌将异步智能编程助手 Jules 正式发布,它基于 Gemini 2.5 Pro 模型,可执行多种编程活动。采用异步模式,直接接入代码库。测试阶段开发者反馈多,正式版有三种访问层级,但部分用户对其界面和输出质量不满。

InfoQ
算法论文8

英伟达、港大等发布创新KV缓存,实现扩散模型无训练加速

多数开源扩散语言模型推理效率不如自回归模型,英伟达、港大、麻省理工研究人员联合提出Fast - dLLM。它用近似KV缓存机制减少冗余计算,还提出基于置信度的平行解码策略,测试显示能加速且保持生成质量。

AIGC开放社区
产品应用8

真·全民AI健康管家来了!实测蚂蚁AQ:追问识药看皮肤,还能连医院接硬件

蚂蚁上线AI健康管家APP——AQ,有超百项AI功能,连接超5000家医院、近百万医生等。它能追问识药看皮肤,打通硬件,设语音通话。凭借技术和生态优势,实现从技术工具到健康管家的跃迁。

量子位
新闻资讯7

刚刚,LMArena最新模型榜单出炉!DeepSeek-R1网页编程能力赶超了Claude Opus 4

LMArena最新模型榜单出炉,DeepSeek - R1(0528)表现亮眼。在文本基准测试中整体排第6、开放模型中排第一,细分领域也成绩优异,在WebDev Arena平台与闭源大模型并列第一,超Claude Opus 4。

机器之心
新闻资讯8

Qwen3.8-Max 正式版终于发布了,能不能打过 GPT 看这里

Qwen 3.8 Max 正式发布,沿用 Qwen 3.5 架构,参数量扩展,重点提升 Coding、Work 和 Agent 能力。它将开放权重,价格有优势。在多项测试中表现出色,还新增多模态能力,已可使用并有优惠。

MacTalk
算法论文8

一个问题几百美元,DeepMind智能体一次搞定了9个Erdős问题

DeepMind团队的大模型在一次‘测试’中解决9个开放的Erdős问题,还自动验证,解法通过人工审查。其框架AlphaProof Nexus结合大模型与Lean编译器,研究展示了AI辅助正式证明搜索技术潜力。

机器之心
产品应用7

MMX-CLI给AI Agent装上七种感官,内容创作更方便

MiniMax发布的MMX - CLI命令行工具,给AI Agent装上七种新感官,具备图像生成、视频创作等能力,可一站式解决内容创作问题。它安装使用简单,功能多,还能集成到现有工作流,不过采用按量付费。

AI工程化
新闻资讯8

Claude深夜彻底「虾化」!一句话接管电脑打工,手机指挥7×24小时不停

Claude获批全自主接管全球打工人的电脑,能自主访问并操作各类软件。只需手机发指令,它就能干活。Anthropic还在研发手机使用功能,敲/schedule命令能让Claude定时工作,成全天候员工。

新智元
算法论文8

机器人终于「懂」家务了!伯克利MomaGraph让机器人像人一样做家务

过去家用机器人做家务存在诸多难题,最近加州伯克利和马里兰大学联手推出 MomaGraph 技术。该技术采用「Graph - then - Plan」思路,团队搭建了完整体系,在星动 Q5 上测试效果好,让家用服务机器人迈向实用。

机器之心
开源动态7

深度拆解:如何在 LangChain DeepAgents 中复现 Claude 的 Skills 机制 ?

本文探讨在LangChain的DeepAgents框架复现Claude的Skills机制。先回顾Skills,它是Anthropic提出的Agent能力注入方式,有渐进式加载特点。接着介绍让通用框架支持Skills的环节,最后测试验证其效果和收益。

AI大模型应用实践