「可验证推理」共找到 6130 篇相关文章
OpenClaw中国行北京站落幕,3万人围观养虾,本周12城活动继续
2026年3月21日,OpenClaw中国行首站北京站举办,近200名开发者参与,直播间3万多人围观。活动上开发者30分钟可跑通AI应用,多位嘉宾分享使用经验,本周末将在12城继续开展。
蚂蚁深夜开源比肩Genie 3的世界模型,我也看到了具身智能的未来。
蚂蚁旗下灵波科技凌晨开源世界模型LingBot-World,可对标Google Genie 3。它能实时交互生成世界,与视频生成模型不同。有三个版本,具备长时记忆稳定、风格泛化性强、动作代理出色等特点。
Zed 为什么不用自己造 Agent?OpenAI 架构师给出答案:Codex 重划 IDE × Coding Agent 的分工边界
文章围绕Coding Agent展开,介绍其构成、构建Harness的挑战,还阐述Codex作为集成系统优势、使用方式及未来发展。强调将模型与Harness共同开发,能更好理解模型行为,Codex可助力构建差异化产品。
缩放定律Scaling正慢性死亡,算力收益递减,AI的下一个增长极是模型如何交互
前Google Brain科学家Sara Hooker论文指出,统治AI十年的缩放定律Scaling走向慢性死亡,算力收益递减,研究重点将转向推理时算力和模型如何交互,还分析了算力崇拜兴起、缩放法则裂痕及未来方向。
Claude 4.x 的提示工程实战指南
Anthropic在官方文档上线Claude 4.x提示工程指南,针对4.5系列模型优化。介绍基本原则、长期推理和状态跟踪方法、沟通风格,还给出特定场景指导及迁移考虑,助你发挥Claude 4.x实力。
替代n8n,用TypeScript写工作流
文章指出n8n、Zapier拖放式工作流调试难、自定义受限,介绍Bubble Lab工具,其用TypeScript实现,代码可自由修改,执行信息透明,还支持导入n8n工作流文件再开发,有一定优势。
Apple发布新SOTA Manzano:混合Tokenizer破解多模态统一难题,理解与生成双翼齐飞
多模态AI前景广,但现有模型在理解和生成任务上存在性能冲突。苹果提出Manzano模型,用混合视觉标记器降低任务冲突,结构简单可扩展,在多基准测试达SoTA水平,还展示图像编辑潜力。
表格理解新纪元!上交大等联合开源,半结构化表格问答准确率提升40%!
数据密集型工作中半结构化表格处理难,传统工具和GPT - 4o表现不佳。上海交通大学等联合开源ST - Raptor,通过VLM、HO - Tree算法和LLM推理,解决复杂表格问答问题,支持多格式,适用于多场景。
突发!字节开源 36B 模型Seed-OSS
字节跳动Seed团队开源Seed-OSS系列36B模型,用12T tokens训练,采用Apache-2.0许可证。该模型能灵活控制推理预算,有两个基座版本,Instruct版在多方面表现强劲,性能碾压OpenAI开源模型。
我用AI同传干掉了英语发布会,爽。
作者因听不懂英语发布会,借助豆包同传2.0 API自制AI同传工具。虽开发遇诸多难题,但最终用音频重定向解决。该工具能实时翻译,还可复刻音色,也肯定专业译员能力。