系统架构能力」共找到 5806 篇相关文章

算法论文8

LLM应用测试范式的进化

文章指出传统软件测试方法在LLM应用中存局限,探讨将其与AI评估结合应对挑战。抽象出LLM应用三层架构模型,分析传统测试范式适用性,介绍AI安全分析方法,阐述测试挑战、范式转变及协同测试策略。

AI与安全
新闻资讯8

MLLM集体翻车,缺乏婴儿级常识!业界首个核心认知基准发布,LeCun转赞

当前大模型在12项核心认知上普遍落后人类10 - 30%,越大的模型越易靠「背答案」糊弄。团队公开首个系统评测框架和题库,用Concept Hacking方法识破模型真假理解,指出模型存在核心知识缺失等问题。

新智元
算法论文8

新范式来了!新能量模型打破Transformer++扩展上限,训练扩展率快35%

研究训练新能量模型 EBT,为输入和预测分配能量值,模拟思考过程。它有跨模态、跨任务通用性,训练扩展率比 Transformer++ 高 35%,推理性能提升 29%,还在多任务中表现出色,是扩展模型能力新范式。

机器之心
开源动态8

社区供稿 | Jina Embeddings V4: 为搜索而生,多模态多语言向量模型

Jina AI发布多模态向量模型jina-embeddings-v4,参数38亿,能同步处理文本与图像。内置LoRA适配器强化检索等任务表现,在多基准测试中展现顶尖性能,支持单/多向量表示。介绍了架构、上手指南等。

Hugging Face
新闻资讯8

决战8月!Anthropic甩出Fable 5.1,奥特曼携GPT-6连夜汇报

GPT - 6和Fable 5.1很可能8月上线。奥特曼赴华盛顿汇报GPT - 6,它有原创科研等能力。Anthropic准备以Fable 5.1狙击,定价不变。GPT - 6有技术突破,但也有安全风险,8月对决将影响AI产业走向。

新智元
产品应用8

国内首张防爆资质、全球首个加油大脑方案,他们凭什么拿下两个「第一」

今年是具身智能商业化落地关键年,深圳若愚科技携自研「若愚九天机器人大脑」及特种防爆机器人「若愚揽月 01」亮相。其拿下国内首张防爆资质,推出全球首个加油大脑方案,在多场景验证能力,技术有多项创新。

机器之心
推荐文章7

一文带你看懂,火爆全网的Skills到底是个啥。

文章介绍了火爆AI圈的Skills,它热度堪比当年的Prompts。文中通过AI选题系统和整合包生成器两个案例展示其应用,还对比了它与Prompt、MCP的区别,介绍了基本配置及安装方法,强调其价值在于复用。

数字生命卡兹克
开源动态8

美团开源全模态,比肩顶级闭源模型,开源新SOTA

美团LongCat团队发布5600亿参数开源全模态模型LongCat - Flash - Omni,它有端到端全模态架构,能实现毫秒级实时音频 - 视觉交互。该模型训练采用渐进式策略,工程上有高效技术支撑,在多基准测试表现出色。

AIGC开放社区
算法论文8

仅看视频就能copy人类动作,宇树G1分分钟掌握100+,UC伯克利提出机器人训练新方式

UC伯克利团队研发出名为VideoMimic的新系统,能将视频动作迁移到真实机器人。它已让宇树G1模仿100多段人类动作,还能适应各种地形。其工作流程含视频转仿真、仿真训练策略、策略迁移到实体机器人。

量子位
开源动态8

大模型开网店,谁是经营高手?E-Commerce Bench开源揭秘

为评估模型长程经营能力,联合淘天集团发布E-Commerce Bench,以10万本金、365天经营网店来评测。从多维度评估18个模型,结果差异大,还发现单一指标会掩盖模型表现,评估基准潜力大。

千问大模型