大模型测试」共找到 9823 篇相关文章

新闻资讯7

硅谷VC新玩法"Kingmaking":还没写代码也能拿到上千万投资

过去半年,三家未成型AI公司各获超5000万美元投资。如今VC采用“造王术”,在代码未写时就砸钱。因模型烧钱、头部效应强,投资人想用钱堆出“冠军”,这也给小团队带来机会。

AI工程化
开源动态8

MIRIX重塑AI多模态长期记忆:超Gemini 410%,节省99.9%内存,APP同步上线

UCSD和NYU团队推出开源的MIRIX,全球首个多模态、多智能体AI记忆系统。它表现亮眼,在多任务中超越传统方法,有类人记忆系统等特点,还上线Mac端应用,开启模型从对话生成到长期记忆驱动心智的新周期。

机器之心
产品应用8

“天下苦CUDA久矣!”KernelCAT率先掀桌,实现国产芯片无痛适配

中国AI产业与英伟达GPU及CUDA生态深度依赖,国产AI根基脆弱。KernelCAT作为AI Agent,能开发高性能算子,在昇腾芯片调优测试中表现出色,还能让国产模型在昇腾芯片上高效部署,实现35倍加速。

InfoQ
产品应用7

实测可灵O1,AI视频界的Banana也来了。

可灵推出全新多模态视频模型可灵O1,融合多种视频生成与修改能力。实测显示,它能实现视频内容增删、特定内容修改、扣绿幕、动作迁移、风格更改等功能,虽有局限,但开启用嘴改视频新时代。

数字生命卡兹克
新闻资讯7

1 亿美元 ARR、不设 AI 硬件产品经理,Plaud 如何拿下全球百万用户?

2023年6月Plaud AI推出AI录音卡片Plaud Note,一年多交付30万台、ARR达1亿美元,今年7月全球出货量达100万台。Plaud中国区CEO莫子皓称其更像模型公司,无真正对手,分享了产品观和招人标准等。

AI前线
产品应用7

实测DeepSeek V3.1,不止拓展上下文长度

文章实测了DeepSeek V3.1和V3,发现V3.1在编程、写作、翻译等方面有变化,如编程更全面、写作风格变文艺等。网友测试其在aider得分71.6%成非推理模型SOTA,但线上API有问题。

量子位
算法论文8

四足机器人首次同时「思考+走路」,北提出链式推理MobileVLA-R1

在「模型+机器人」浪潮中,让机器人既听懂话又走得对、稳很难。北MobileVLA - R1将链式思考引入四足机器人,在仿真和真实实验中对标强基线实现提升,构建了更具工程可用性的范式。

新智元
算法论文8

工具增强的多模态LLM综述

多模态语言模型(如GPT - 4V)虽有强图文理解能力,但受数据稀缺、复杂任务表现不佳和评估标准不统一限制。论文提出为MLLM集成外部工具,构建全景图,覆盖多维度,还指出挑战与对策。

深度学习自然语言处理
开源动态7

vLLM Ascend超越MindIE? 昇腾推理Qwen3与DeepSeek R1 Distill性能实测

国内开发者在昇腾NPU上进行模型推理面临挑战,华为MindIE推理引擎使用门槛高。昇腾联合vLLM社区推出vLLM Ascend插件。本文用GPUStack平台实测其与MindIE性能差异,得出两者在不同场景各有优势的结论。

AI工程化
推荐文章7

拒绝强行AIGC!| 一种安全实用、准确率高的Text2Sql方案

在金融、医疗等对精确性、透明度和安全性要求高的领域,完全依赖模型NL - to - SQL能力易出错。本文提出基于函数调用LLM的新范式,将LLM能力聚焦于调用预定义功能函数,提升了数据检索的准确性、透明度和可维护性。

AINLPer