「先行指标」共找到 299 篇相关文章
AI 创业,需要重读 Paul Graham 的「创业 13 条」
2009年YC创始人Paul Graham发表《Startups in 13 Sentences》,虽时间久远但核心观点不过时。创业者Chris Saad、Yaniv Bernstein结合经验和当下环境,剖析这13条创业原则,涵盖选联合创始人、快速发布产品等内容。
忘记大模型,英伟达:小模型才是Agentic AI的未来!
截至2024年末,Agentic AI领域获超20亿美元初创公司融资。NVIDIA研究报告显示,多数Agentic AI场景中,小型语言模型已足够强、更适配、更便宜,LLM-to-SLM迁移是必然趋势。
“甲方快乐模型”诞生,拿下平面设计新SOTA!多条件一键生成,还能独立调整元素 | 复旦&字节
复旦大学和字节跳动团队联合提出CreatiDesign新模型,可实现高精度、多模态、可编辑的AI图形设计生成。它解决了以往方法在处理图形设计时的难题,在多维度评估基准上表现出色,还支持多轮编辑。
华为创造AI算力新纪录:万卡集群训练98%可用度,秒级恢复、分钟诊断
大模型落地需强大算力集群支撑,构建万卡级算力集群是顶尖挑战。华为昇腾万卡算力集群近乎‘永不罢工’,其公开技术秘密,提出‘3+3’双维度技术体系,多项指标表现优异。
预测误差仅0.26mm,中科院自动化所×灵宝CASBOT团队让机器人提前“知道你要干嘛”
中科院自动化所与灵宝CASBOT提出DTRT方法获ICRA 2025录用。该方法利用Transformer和博弈论,将人类动态纳入长期预测,实验显示其预测精度和协作表现显著优于现有技术,有巨大应用潜力。
The Batch: 978 | DeepSeek-V4-Pro 更新了
DeepSeek发布旗舰模型DeepSeek-V4-Pro-0813正式版,性能提升,还发布开源agent harness开发者预览版并提价。模型在多指标表现佳,编码能力改进明显,公司公开基准测试框架意义大。
让机器人「秒懂人话」!中国电信TeleAI发布首个实时文本驱动人形机器人控制框架TextOp
中国电信人工智能研究院(TeleAI)具身智能团队推出人形机器人TextOp通用小脑,首创流式文本驱动的实时小脑控制范式。用户发文本指令,机器人就能实时理解、无缝切换动作,在多场景有应用潜力。
先解行为,再训Agent:CMU开源首份Agentic Search日志数据,把Agent拆开给你看
CMU团队基于DeepResearchGym平台,从半年真实流量中整理出数据,构建并在Hugging Face开源首个Agentic Search行为日志数据集。还提出三层分析框架,刻画智能体搜索行为,为研究和系统设计提供基础与信号。
大模型Agent的核心还是prompt? 目前有什么挑战?
文章指出大模型Agent核心并非Prompt,而是工程化架构设计、工作流编排与数据闭环。介绍Flow Engineering等概念及工具,分析规划、记忆、工具使用要点,还谈及开发面临的延迟、稳定等挑战,并给出应对建议。
别再用单选评测骗自己了!Amazon新论文揭示了大模型在多选题中的3种系统性偏差
Amazon新论文揭示大模型做多选题有3种系统性偏差,如选择、数量、猜测偏差。还推出SATA - Bench评测,给出10个测量指标,提出Choice Funnel解码策略,能提升小模型多选题正确率。