测试任务」共找到 3332 篇相关文章

开源动态8

外卖公司也能搞AI?

昨天凌晨美团悄悄开源560B参数的MoE大模型LongCat-Flash-Chat,引发国外网友疑惑。该模型推理速度超100 tokens/秒,基准测试表现出色,多项设计解决实际问题,贴合美团业务需求。

AGI Hunt
开源动态8

DeepSeek V3.1 Base突袭上线!击败Claude 4编程爆表,全网在蹲R2和V4

昨晚,DeepSeek官方悄然上线全新V3.1版本,上下文长度拓展到128k,参数685B,支持多种精度格式。其编程能力突出,在Aider测试中霸榜,性能超越Claude Opus 4,还有成本低等优势。

新智元
算法论文8

一篇120页AI4Research(科学研究AI)最新系统性综述

为填补AI在科学研究应用缺乏全面综述的空白,提出AI4Research调查。其主流流程和分类分五个关键领域,各领域细分任务,凸显AI在研究中多样角色,还介绍多学科应用。

PaperAgent
开源动态8

真狠!4 万 Star CodeWhale,AI 写代码最怕的是什么????

文章介绍开源的CodeWhale,它是terminal coding agent harness,GitHub超4万Star。它给代码Agent定规则,涵盖身份、证据等原则。支持多模型,有任务流程和多Agent协作功能,还分析适用人群并给出启动方法。

小华同学ai
产品应用8

手残党跪了,Pi 0.6机器人15分钟学会拧螺丝,能进厂边干边学了

具身智能领域 Physical Intelligence 公布新进展,借助「RL token」法,让机器人短时间掌握精细操作。该方法给 VLA 加「外挂」,使机器人进化快、学习效率高,在多项任务测试中表现出色。

机器之心
开源动态7

本周 5 个实用的 Github 开源项目,真香!

文章介绍本周5个实用Github开源项目。有资源聚合媒体中心stremio-web,AI原生安全测试平台CyberStrikeAI,本地优先AI编程远控工具hapi,智能股票分析系统daily_stock_analysis,纯前端JavaScript GUI智能体框架PageAgent。

开源先锋
开源动态8

英伟达世界模型再进化,一个模型驱动所有机器人!机器人的GPT时刻真正到来

英伟达GEAR实验室提出DreamZero,是基于预训练视频扩散骨干网络的世界动作模型,有140亿参数,能让机器人通过文本提示完成未见任务。它解决了传统模型问题,在多方面表现出色,代码已开源。

机器之心
产品应用8

360发布全球最强视觉语言对齐模型!榜单全面领先!

360发布FG - CLIP 2双语细粒度视觉语言对齐模型,几乎在所有数据集上全面领先。它能让AI在统一框架内看懂图像细节、理解中英双语,团队还提出新中文多模态评测基准。

AIGC开放社区
开源动态8

3B Image Captioning小钢炮重磅来袭,性能比肩Qwen2.5-VL-72B

文章推荐Dense Image Captioning新技术CapRL,它首次将DeepSeek - R1强化学习法用于image captioning,创新定义reward。训练的CapRL - 3B模型性能比肩Qwen2.5 - VL - 72B,解决了reward设计难题,已开源相关内容。

机器之心
算法论文8

规范对齐:回答前的深思,让安全与行为边界更清晰

OpenAI等厂商将规范融入大模型。上海交大等团队提出规范对齐概念,构建评测基准SpecBench,揭示主流模型不足。探索测试时深思方法,如Align3,能提升模型规范遵循度,项目已开源。

深度学习自然语言处理