「DeepSeek V3.1」共找到 3870 篇相关文章
GPT-5.1发布当天,文心5.0杀回来了
2025百度世界大会发布文心5.0,这一2.4万亿参数的原生全模态模型,训练之初融合多模态数据,支持联合输入输出。同日OpenAI推出GPT - 5.1,文心5.0在多方面表现出色,如情绪安抚更贴心、多模态理解能力强等。
Claude Opus 4.1模型发布,OpenAI继续被拉开差距
Anthropic发布Claude Opus 4.1模型,在各指标上超越Opus 4。Anthropic ARR达50亿美元,API收入首超OpenAI。新模型在多场景有进步,官网等渠道统一可用,还给出Claude Code使用建议。
SceneGen: 单图像驱动的多资产3D 场景生成
上海交通大学提出SceneGen框架,可从单张场景图像及其对应目标掩码中,同时生成带有几何结构与纹理的多个3D资产。它一次前向传播即可完成生成,在效率与稳健性上优于现有方法,虽有局限但应用潜力大。
1200行代码逆袭!DeepSeek工程师开源轻量级vLLM,吞吐量逼近原版
开源 vLLM 可提升 LLM 推理速度和资源利用率。近日,DeepSeek 工程师俞星凯开源轻量级 Nano - vLLM,代码仅 1200 行,基准测试中吞吐量逼近原版,项目已在 GitHub 获 200 多 Star。
DeepSeek-R1推理智能从哪儿来?谷歌新研究:模型内心多个角色吵翻了
过去两年大模型推理能力跃迁,谷歌等机构研究指出,推理能力提升源于模型推理时隐式模拟类多智能体交互结构“思维社会”,还提出利用“群体智慧”新方向,并介绍了研究方法、实验结果等。
700万参数击败DeepSeek R1等,三星一人独作爆火,用递归颠覆大模型推理
今年6月Sapient Intelligence提出的HRM影响大模型推理结构,四个月后三星研究员Alexia Jolicoeur - Martineau推出TRM,700万参数模型在推理基准测试中超越参数多10000倍的模型,还介绍了TRM原理、改进及实验结果。
ICML 2025 | 清华、上海AI Lab提出专家级医学基准MedXpertQA,看o3、R1哪家强
本文由清华和上海AI Lab学者撰写,提出专家级医学基准MedXpertQA。现有医学基准难度和临床相关性不足,而MedXpertQA极具挑战、临床相关性高,构建严格,评测显示前沿模型在医学领域提升空间大。
GitHub 1.3k 一款能“填色回忆”的神器:DDColor 让老照片鲜活又逼真
DDColor是阿里达摩院团队提出的新一代图像自动着色模型,基于双重设计,能实现高保真、真实感强的黑白图转彩色图。它兼容多种类型图片,有诸多核心功能,相比传统模型优势明显,应用场景广泛。
手机跑多模态也能快到飞起!面壁MiniCPM-V 4.6开源
面壁智能开源多模态模型MiniCPM-V 4.6,以低算力成本、超低首Token延迟打通三大主流手机操作系统。它算力瘦身性能强,是视觉语言多面手,还适配主流系统,降本增效,让AI能力从云端到指尖。
清华挖出「幻觉」的罪魁祸首:预训练产生的0.1%神经元
清华大学孙茂松团队从神经元角度研究LLM幻觉微观机制,发现不到0.1%的H - 神经元可预测幻觉,与过度顺从行为相关,根源在预训练阶段,为解决幻觉问题、开发可靠大模型提供新思路。