模型能力连续体」共找到 9034 篇相关文章

新闻资讯7

黄仁勋倡议的开源联名信,Anthropic 为何不愿签名?

黄仁勋分享支持开放权重模型的联名信,NVIDIA、Google等公司联署,Anthropic缺席遭网友讨伐。Anthropic研究人员回应引争议,这场讨论或存在错位,分歧关键在于发布前评测能否支持模型权重长期外授。

AI科技评论
开源动态8

外卖公司也能搞AI?

昨天凌晨美团悄悄开源560B参数的MoE大模型LongCat-Flash-Chat,引发国外网友疑惑。该模型推理速度超100 tokens/秒,基准测试表现出色,多项设计解决实际问题,贴合美团业务需求。

AGI Hunt
算法论文8

AI“压力面”,DeepSeek性能暴跌近30% | 清华&上海AI Lab

上海人工智能实验室等团队设计REST框架,在一个prompt里抛多问题模拟复杂推理场景。结果显示,DeepSeek - R1等模型高压下性能大幅缩水,REST能拉开不同模型差距,还揭示评测方法局限。

深度学习自然语言处理
新闻资讯7

AI 精神病的巅峰:Claude Mythos 和 OpenAI Spud 还没上线,就有人度假都睡不着了

还未发布的Claude Mythos和OpenAI Spud在舆论场引发热议,大众情绪被拉高。OpenAI推出GPT - 5.4 - Cyber,还跟进‘安全’故事。网友对‘模型太危险只能少数公司用’说法存疑,同时GPT - 6等新模型消息不断。

InfoQ
算法论文8

规范对齐:回答前的深思,让安全与行为边界更清晰

OpenAI等厂商将规范融入大模型。上海交大等团队提出规范对齐概念,构建评测基准SpecBench,揭示主流模型不足。探索测试时深思方法,如Align3,能提升模型规范遵循度,项目已开源。

深度学习自然语言处理
新闻资讯7

DSpark推理速度提升80%后,OpenAI宣布新方法将推理成本降低了一半

近日,OpenAI 工程师开发优化技术,将模型推理成本降一半。业内猜测或基于公开成果,也有人认为是模型量化。此前 DeepSeek 推出 DSpark,使 V4 模型推理速度提升 60%-85%,还引入峰谷定价机制。

AI科技评论
新闻资讯7

35天,版本之子变路人甲:AI榜单太残酷!

LMSYS榜单揭示大模型残酷现实,如Claude 3 Opus从榜首暴跌,大模型“霸主保质期”仅35天,这对应用层开发者是降维打击,未来生存要么做“游击队”,要么挖掘模型无法碾压之物。

新智元
算法论文8

爆火论文颠覆RL认知!「错误奖励」让LLM推理暴涨24.6%,学界惊了

最新爆火论文颠覆传统RL训练认知,华盛顿大学等团队证实「伪奖励」可让LLM推理性能提升。研究设置多种伪奖励形式实验,发现其对Qwen模型有效,但并非对所有模型都有效。

新智元
开源动态8

全景视觉的Depth Anything来了!Insta360推出DAP,200万数据打造全场景360°空间智能新高度

Insta360等团队推出全景度量深度基础模型DAP,构建200万量级全景数据引擎,设计三阶段伪标签管线,在模型架构上也有创新,在多项测试中效果优异,项目代码与模型已开源。

机器之心
新闻资讯7

Le Chat全方面对标ChatGPT,欧洲AI新贵穷追不舍

欧洲AI初创公司Mistral AI接连发布多个开源模型,还升级Le Chat,引入深度研究、语音等新功能,全方面对标ChatGPT。其语音识别模型Voxtral号称“全球最佳”,多方面超越竞品。

机器之心