「推理成本」共找到 3261 篇相关文章
刚刚,美国AI霸主换了!Anthropic年收300亿,碾压OpenAI
外媒披露Anthropic年化营收达300亿美元,超越OpenAI的240亿。Anthropic由OpenAI前员工创立,15个月营收翻30倍,训练成本仅为对手四分之一。其80%收入来自企业端,而OpenAI陷入‘增收不增利’怪圈,内部也矛盾重重。
Deepseek V4 Pro深夜上线,性能追平Fable 5,但价格只有它的2%
2026年8月12日,DeepSeek V4 Pro正式版上线。它是混合专家模型,规模居世界第一梯队。价格比Claude Fable 5便宜超98%,成本优势明显。其架构节省成本,API开放多模式,产品结构清晰。
让思考更准更长!强化学习新算法FIPO来了
阿里通义实验室Qwen Pilot团队发布系列博客剖析大模型强化学习机制与局限,推出新算法FIPO。该算法引入Future - KL机制,解决‘推理长度停滞’问题,在多项测试表现优异,还介绍招聘信息。
The Batch: 949 | 人形机器人进入工厂车间
少量人形机器人已进入工业场景,成本接近人力成本。Agility Robotics向Schaeffler提供Digit机器人,负责搬运箱子。目前工业人形机器人应用有限,多处于试点,预计到2040年数量将大增。
DeepSeek|从零构建轻量级vLLM:Nano-vLLM,吞吐量逼近原版,代码仅需1200行
开源的vLLM能提升LLM推理速度和资源利用率。近日,DeepSeek AI俞星凯从零构建轻量级Nano - vLLM,代码仅1200行。它有离线推理等功能,基准测试显示吞吐量逼近原版。
Qwen3-Max-Thinking:会想能干,比强更强
正式推出旗舰推理模型 Qwen3 - Max - Thinking,其在多关键维度显著提升,性能媲美顶尖模型。引入自适应工具调用和测试时扩展技术,现已上线 Qwen Chat,API 也开放,还介绍了使用方法。
智谱GLM-5强调的Agentic Engineering能力是什么?|甲子光年
智谱上线并开源GLM - 5,在Coding与Agent能力上达开源SOTA,刺激股价上涨。它验证了Agentic Engineering可行性,提升能力阈值,但成本阈值也更显性,未来软件工程或分层发展。
OpenAI主攻速度的第一个模型来了:GPT‑5.3‑Codex‑Spark
OpenAI发布GPT-5.3-Codex-Spark,是GPT-5.3-Codex轻量级版本,也是首个为实时编程设计的模型。亮点是速度快,推理超每秒1000 token,已向ChatGPT Pro用户开放,后续规划融合两种工作模式。
首个基于 MCP 架构的低代码 RAG 框架
检索增强生成系统复杂度提升,科研人员面临高昂工程成本。清华大学等联合推出 UltraRAG 2.0,基于 MCP 架构,降低复杂 RAG 系统技术门槛与学习成本,支持低代码构建复杂系统。
4.1K Star!发现一个超轻量的 OpenClaw 平替项目,比 OpenClaw 内存少 99%!
开发者运行OpenClaw成本高,Sipeed推出超轻量开源项目PicoClaw。它内存占用小于10MB,成本只需10美元硬件,启动快、可移植,功能全,还介绍了入手方式和技术路线。