4B参数」共找到 2500 篇相关文章

新闻资讯8

第一作者必须是AI!首个面向AI作者的学术会议来了,斯坦福发起

斯坦福大学宣布将于2025年举办科学AI智能体开放会议,投稿要求第一作者必须是AI,由其主导论文创作。会议评审主要用AI,人类专家最终评估。目标是探索AI驱动科研的未来,建立规范。

机器之心
新闻资讯8

ChatGPT那一套要过时了?翁荔实测创业首个模型,回合制AI被“原生实时交互”秒了

Thinking Machines推出交互模型TML - Interaction - Small,可实时接收多模态输入并响应,性能超现有实时系统。该模型未开放,计划先有限预览再广泛发布,若开放将为企业带来巨大价值。

AI前线
开源动态8

DeepSeek 硬核开源 DeepSeek-OCR-2!弃用 CLIP 改用 Qwen,创新视觉因果流!

昨天开源社区热闹非凡,Kimi 发布 K2.5,DeepSeek 则推出 DeepSeek - OCR - 2,用 LLM 架构替换传统 CLIP 视觉编码器。它核心创新是视觉因果流,能智能规划阅读路径,性能高效且全量开源。

开源星探
开源动态8

Day0迁移、一键部署,华为开源的昇思MindSpore成为大模型开发的“万能钥匙”

在大模型无法一统天下的背景下,开发者面临在一个框架、生态体验众多主流大模型和AI技术的难题。华为开源的昇思MindSpore可实现训练Day0迁移、推理一键部署,还介绍了其相关技术和实测效果。

量子位
算法论文8

成本暴降88%!通义实验室、北大发布ZeroSearch,无需搜索即可激活LLM检索能力

信息检索能力对提升大语言模型推理表现至关重要,但现有方法在训练中面临文档质量不可控和搜索 API 成本高昂两大挑战。为此,通义实验室和北大提出 ZeroSearch 框架,无需真实搜索即可激活 LLM 检索能力,显著降低成本。

机器之心
开源动态8

OpenAI深夜开源HealthBench,60个国家合力开发5000段真实对话

今天凌晨1点30,OpenAI开源医疗大模型测试评估集HealthBench。其5000段核心测试对话由60个国家/地区的262名医生打造,采用多轮对话测试。测试显示大模型在医疗保健领域表现显著提升,还介绍了其构建及评估等情况。

AIGC开放社区
开源动态9

SGLang 某些模型的 CUDA Graph 为什么会有上百条 decode cuda stream?

本文分析SGLang运行DeepSeek-V4.1时,CUDA Graph出现上百条decode CUDA流的问题成因,介绍开源PR的修复方案,分享了压缩profiler显示行数的实用脚本方法。

GiantPandaLLM
新闻资讯7

刚刚,OpenAI花470亿大规模回购股票,高管火速跳车离场!

OpenAI花70亿美元从员工手中回购股份,交易估值8520亿美元。公司6月已提交IPO申请,但此举或意味着上市推迟。同时,多位高管离职,包括伦理负责人,且无继任者。外部竞争加剧,Anthropic势头强劲。

新智元
开源动态8

机器人看29s视频学会一个新技能,自变量开源HOST框架

自变量机器人开源的HOST框架,让机器人看29s人类示范视频就能学会新技能,原技能不受影响。它通过自定位级联预测,解决了人和机器人动作节奏、身体结构不同的问题,效率远超主流微调方案,推动机器人进家庭。

PaperAgent
新闻资讯7

GitHub Issues 大改造:用缓存和预取,让页面打开快了数倍

GitHub 重新设计 GitHub Issues 导航架构,通过客户端缓存、预测性预取等机制,提升导航性能,使即时导航体验比例从 4%增至 22%,解决大型 Web 应用常见的延迟问题。

InfoQ