商业新模式」共找到 4571 篇相关文章

新闻资讯8

Claude模型危险,鲍威尔召集华尔街紧急开会!全美安全股暴跌2万亿

Anthropic的模型Mythos能力超强,被指或对金融业造成重大风险。鲍威尔和贝森特紧急召集华尔街开会预警。消息传出,美国软件板块暴跌,SaaS领域近2万亿美元市值蒸发。Anthropic拒绝向公众发布该模型,启动防御项目。

新智元
算法论文7

DeepSeek的GRPO会导致模型崩溃?看下Qwen3范式GSPO

文章围绕大语言模型后训练阶段的强化学习算法展开。介绍了OpenAI的RLHF、DeepSeek的GRPO,重点指出Qwen团队发现GRPO有稳定性问题,会致模型崩溃,进而提出算法GSPO,实验显示其效率和可扩展性更佳。

机器之心
算法论文8

SFT在帮倒忙?研究:直接进行强化学习,模型多模态推理上限更高

学界常用「监督微调(SFT)+ 强化学习(RL)」训练大模型。但研究发现,SFT 会引发「伪推理路径」,阻碍推理进步。相比之下,直接进行 RL 训练,模型多模态推理上限更高,该团队训练的模型还刷了纪录。

机器之心
新闻资讯7

他们想用AI发现不存在的物理学,然后用它去半人马座

美国初创公司 Physical Superintelligence(PSI),计划用 AI 加速物理发现。其核心平台 Emmy 能拆解研究问题。商业应用从 AI 数据中心切入,还参与费米探索者星际探测任务,目标平衡学术与商业

DeepTech深科技
产品应用7

Thinking Machines 发布 Tinker,重定义 LLM 微调的边界

Thinking Machines 发布工具 Tinker,它是灵活的语言模型微调 API,采用‘责任分工’模式,让研究者专注算法创,不用被运维细节拖累。此模式获 Karpathy 赞赏,目前 Tinker 开始内测,理念受欢迎。

AI工程化
开源动态7

智谱模型也用DeepSeek的MLA,苹果M5就能跑

智谱AI上市后发布成果,开源轻量级大语言模型GLM-4.7-Flash,API免费开放调用。该模型是30B总参数、3B激活参数的MoE架构,定位为“本地编程与智能体助手”,评测表现佳,采用MLA架构,多平台支持。

量子位
新闻资讯7

5个月估值翻10倍,AI数据赛道跑出一家独角兽

成立约18个月的AI训练数据公司AfterQuery正筹一轮融资,估值达32亿美元,5个月涨超10倍。它最初想开发AI智能体,后转收集训练材料。此赛道已有多家高估值公司,且数据隐私和安全风险待解。

DeepTech深科技
开源动态7

R1一周年,DeepSeek Model 1悄然现身

2025年1月20日,DeepSeek发布DeepSeek - R1开启开源LLM时代,其在Hugging Face获赞最多。一年后,DeepSeek模型Model1在GitHub现身,经Gemini分析或为DeepSeek - V4,还给出相关技术细节。

机器之心
开源动态8

华为开源!扩散语言模型突破32K上下文,还解锁了「慢思考」

今年文本生成领域从自回归向扩散语言模型转变,但长序列训练不稳定是痛点。华为发布 openPangu-R-7B-Diffusion,将上下文长度扩至 32K,在多基准创 7B 参数量级 SOTA,还解析了其技术革

机器之心
开源动态8

攻克结构化长文档检索难题!框架让模型告别“结构性失明”

SEAL团队推出全对比学习框架SEAL,通过带结构感知和元素对齐,将文档宏观层级结构和微观元素语义融入Embedding空间,提升模型对结构化数据的理解。在BGE - M3模型上提升了MRR@10指标,还开源了万级字数长文档数据集。

量子位