DeepSeek-R1-Distill-Qwen-1.5B」共找到 2447 篇相关文章

算法论文7

Transformer学不会多位数乘法?MIT和哈佛的研究指出了一个简单漏洞

MIT、哈佛和谷歌DeepMind团队实验发现,Transformer做4位数乘法有软肋。用‘隐式思维链’(ICoT)训练的模型准确率达100%,传统方法仅1%。研究揭示了问题根源,还给出修复方案,但也引发诸多质疑。

AI工程化
新闻资讯7

Yann LeCun 炮轰 Anthropic CEO!这人“既要又要”:要么太自大、要么不诚实

向来直言不讳的 Yann LeCun 将‘大炮’轰向了 Anthropic CEO Dario Amodei。Yann 认为 Amodei 作为‘AI 末日论者’却研究 AGI,要么学术不诚实,要么有优越感。而 Amodei 反对《HR1》法案,既肯定 AI 前景,也指出其社会风险。

AI前线
新闻资讯8

一场文心大模型的「AI马拉松」

2025 年模型能力至关重要,百度在基础模型研发持续投入。百度 AI Day 上,吴甜解读文心新模型技术,文心 X1 Turbo 推理强、成本低。百度技术体系完备,未来看好多模态与智能体,降成本促应用生态发展。

机器之心
新闻资讯7

梁圣一涨价,马斯克的订阅突然成了地球上最划算的。

DeepSeek官发涨价第三天,峰谷定价且整体涨幅大,实际体感比价格表夸张,Opencode go也涨价降额度。而马斯克的Supergrok heavy成全球性价比之王,买它送Cursor ultra,还附赠多项权益。

探索AGI
产品应用7

DeepSeekHarness被骂自嗨,还是Agent界Android?

DeepSeek Harness 评论两极分化,有人赞其为‘Agent 界的 Android’,也有人批其‘自嗨’。若将其视为 Agent Runtime 架构实验,它值得拆解。它以‘一切皆插件’理念设计,有诸多独特架构特点。

CourseAI
算法论文8

罕见!Meta、OpenAI、xAI联合分享了用生产环境提升LLM的最佳实践!

Meta、OpenAI、xAI联合发表成果CharacterFlywheel,聚焦在生产环境提升社交型AI对话能力。团队基于LLaMA 3.1迭代15个版本,7/8的A/B测试显示正向提升,介绍了架构、数据管道、奖励模型等内容。

PaperAgent
新闻资讯7

两个Ilya的宿命轮回:老黄10亿美金开启赛博修仙!

OpenAI花1亿美金买Torch做「数据转接头」,想让ChatGPT成全科医生;Claude用超长文本窗口处理医学文献和数据。而NVIDIA投10亿与药企建实验室,用BioNeMo重写生命,开启药物生成新纪元。

新智元
产品应用8

MiniMax秀了波AI视频杂技:越看越惊艳,指令遵循太强了

MiniMax发布海螺2.0版本,能处理极端物理情况,原生支持1080P,在指令遵循、生成质量达一流水平,成本效率破纪录。此前还开源MiniMax - M1,两大底层技术创新让其成果惊艳,展现研发实力。

量子位
新闻资讯8

中国 AI 投资人:练习时长两年半

文章是对多家投资机构的访谈,探讨AI投资与创业趋势。涉及Manus成功经验、DeepSeek影响、模型公司前景、应用机会等,还谈及创业者应对策略、投资策略变化及行业未来思考。

Founder Park
产品应用7

怎么回事?刚被OpenAI收购,Windsurf就发了个自己的模型

5月初,刚被OpenAI收购的Windsurf发布AI编程模型SWE - 1,该模型针对软件工程全流程,核心是流动感知,实现人机自然交接。它有三个系列,已上线可免费使用,开发灵感源于编辑器,在评估和实测中表现良好。

Founder Park