控制面设计」共找到 2071 篇相关文章

产品应用8

单张显卡跑出15倍推理速度,aiX-apply-4B小模型加速企业AI研发落地

3月25日,硅心科技发布专为代码变更应用场景设计的轻量级模型aiX - apply - 4B。该模型在准确率、推理速度等方表现出色,超越部分千亿级大模型,还推出“大模型+小模型”协同架构释放企业算力价值。

量子位
产品应用7

OpenClaw 火了半年,Agent 执行层依然是工程空白

当前主流 Agent 工具链执行层基本空白,Violoop 是少数在执行层做系统化设计的项目。它是桌边触屏硬件,获取三类运行时数据,具备感知 - 判断 - 执行运行时,有多种核心能力,适合特定场景团队评估。

AI工程化
开源动态8

如何定义“人味儿”?——HeartBench评测体系建设实践

在大模型竞争格局生变,情感智能评测缺失的背景下,作者团队发布聚焦AI拟人化的中文评测体系HeartBench,介绍其设计、评估方式、迭代过程等,还沉淀了评测体系构建方法论及专家标注管理思考。

阿里云开发者
开源动态8

OpenClaw 深度解析:一只龙虾凭什么震撼全世界

万字长文深度解析OpenClaw,阐述其核心原理、创新亮点以及对AI行业的深远影响。解读为何大厂难以打造类似产品,剖析简单任务实现困难的根源,还探讨了其设计机制、应用场景、潜在问题及应对策略。

AI科技评论
算法论文8

CL-Bench的故事没有结束,生成式CL-Bench:GENIUS来了

北大团队发布GENIUS,用于评估模型生成式流体智力。它构建含510个样本、20个子任务的评测集,测试模型多方能力。实验显示当前模型流体智力有短板,还提出免训练注意力校准机制提升性能。

机器之心
算法论文8

AI编程真目:完整项目通过率仅27% | 上交大新基准

多校联合团队发布ProjDevBench,评估AI编程智能体端到端项目开发能力。结果显示,六种主流智能体总体提交AC率仅27.38%,从零构建任务中性能大幅下滑,还揭示了智能体多方短板。

量子位
产品应用7

Github 7万星的Clawdbot实测:用国产模型做心脏,躺在床上指挥电脑干活。

本文实测了Github 7万星的Clawdbot(现叫Moltbot),介绍其能在本地运行,可多平台交互,有持久记忆、能控制浏览器等特点,还说明了安装配置过程,指出它虽有不足但想象空间大。

AI进修生
开源动态8

刚刚,杨植麟亲自开源Kimi K2.5!国产大模型打架的一天

今天国产大模型热闹非凡,Kimi更新至K2.5版本。它是万亿参数的MoE基础模型,开源且在多项评测表现佳,视觉与编码能力强,还引入Agent Swarm功能,实测展示其解决各类复杂任务能力。

机器之心
产品应用8

企业级Agent「登月」时刻!1人1周搞定高可用系统,只花5元

12月16日,无问芯穹智能体服务平台发布,为企业提供全链路陪伴式落地服务。它有能力模板和托管服务,能解决企业智能体落地困境,如提升效果、保障稳定、控制成本等,已在多行业验证价值。

新智元
新闻资讯7

Runway重夺全球第一!1247分碾压谷歌Veo3,没有千亿算力也能干翻科技巨头

Runway Gen - 4.5击败谷歌Veo3,以1247的ELO分数在Artificial Analysis榜单中重夺AI视频王座。它在多方树立新标杆,虽有局限,但创始人认为其是通用模拟引擎,应用场景广泛。

新智元