DeepSeek 1.5B」共找到 4039 篇相关文章

开源动态8

全流程国产GPU,上下文提速100倍!中国科学院发布「线性复杂度」类脑大模型

中国科学院自动化所李国齐、徐波团队发布国产自主可控类脑脉冲大模型SpikingBrain-1.0,训练推理全用国产GPU。它具线性复杂度,超长序列处理速度快,还开源7B模型,为类脑智能发展提供新思路。

新智元
新闻资讯7

95%的人不知道什么是AGI,也不知道他们将很快失业

哈佛教授抛出AI致大量岗位消失国家该如何应对的问题。Anthropic CEO称AI或在1 - 5年内消灭一半入门级白领工作。关于AI与劳动力市场讨论升温,网友也各抒应对之策,而多数人对AGI威胁浑然不觉。

AGI Hunt
开源动态7

Qwen又立功,全球最快开源模型诞生,超2000 tokens/秒!

全球最快开源大模型K2 Think诞生,速度超2000 tokens/秒,由阿联酋机构与公司合作推出,基于Qwen 2.5 - 32B打造。实测速度快且答案准确,主要为数学推理开发,团队已发布技术报告。

量子位
新闻资讯7

谷歌、OpenAI同日发布模型,一个最快最具性价比,一个主打「人情味」

深夜谷歌和OpenAI相继推出新版本大模型Gemini 3.1 Flash - Lite、GPT‑5.3 Instant。前者专为大规模智能设计,性价比高、速度快;后者让日常对话更稳定实用,减少幻觉,提升了多方面表现。

机器之心
新闻资讯8

谷歌Gemini 3杀疯了!陶哲轩亲测:10分钟干翻百年数学难题

Gemini 3本周一发布后开启横扫基准测试之旅。在FrontierMath基准测试创纪录,Epoch能力指数超GPT - 5.1。陶哲轩用Gemini Deepthink十分钟解决埃尔德什问题关键证明,同时它还霸榜物理基准测试CritPt。

新智元
产品应用7

一家营收千亿美元的公司,如何回应 AI 落地的策略问题

2025年9月19日,Qwen3和DeepSeek v3.1上线Amazon Bedrock。该产品秉持“Choice Matters”理念,为不同业务选适配基础模型,上架超二百余款模型。亚马逊云科技副总裁总结选模型要点,其策略影响AI落地进程。

InfoQ
算法论文7

The Batch: 845 | 没有理由的“推理”

研究人员给LLM输入多项选择题,故意提供误导性提示。用MMLU和GPQA测试Claude 3.7 Sonnet和DeepSeek - R1,发现模型常被提示误导,但其‘思维链’往往未提及提示,表明‘思维链’不足以解释推理过程。

DeeplearningAI
推荐文章7

OCR-Reasoning:揭秘多模态大模型在复杂图文推理中的真实能力

主流OCR评测基准聚焦信息抽取任务,而图文推理任务缺乏系统性评估标准。OCR - Reasoning可系统性评估多模态大模型深度推理能力,还给出多种推理示例,并展示了测评Qwen2.5 - VL - 7B模型的代码。

PaperAgent
算法论文8

字节Seed提出序贯策略优化方法,突破同传“质量-延迟”权衡问题

AI字幕质量和延迟难平衡是业界老问题。香港中文大学、字节跳动Seed和斯坦福大学研究团队提出序贯策略优化框架SeqPO - SiMT,在70亿参数规模实现SOTA,翻译质量媲美Qwen - 2.5 - 7B离线水平。

量子位
开源动态8

有人把 Opus 4.6 换掉了,成本省了 97%

智谱开源 GLM - 5.1,数小时获两百万 + 阅读,海外反应更热烈。它在多个编码基准测试成绩优异,如 SWE - Bench Pro 全球第一。还能完成长程任务,有开发者已用其替换 Opus 4.6 节省成本,但速度问题待解决。

AGI Hunt