「算力评估」共找到 1474 篇相关文章
Agnes:不做通用型智能体丨对话全民AI应用平台Agnes AI
量子位智库对话Agnes AI创始人Bruce Yang,探讨多智能体在AI产品的应用。Agnes AI以Multi Agent架构为核心,上线四月日活破20万。其介绍了核心功能、单多智能体差异、评估维度等,还谈及目标人群、市场规模等内容。
OpenAI秘密项目曝出!百名投行精英密训AI,华尔街最贵苦力要失业了?
OpenAI秘密项目「Mercury」曝出,正高薪招募百名前投行精英训练财务模型,替代初级银行家重复性工作。业内认为这是其在算力成本高企下加速商业化与盈利的关键一步,也引发对银行从业者就业与成长的讨论。
Codeforces难题不够刷?谢赛宁等造了个AI出题机,能生成原创编程题
LiveCodeBench Pro团队推出AutoCode框架,利用LLM自动化竞赛编程问题创建与评估。该框架结合验证器 - 生成器 - 检查器框架与双重验证协议,在测试用例生成上可靠性佳,还能生成新问题,同时揭示了LLM在创作上的优劣势。
腾讯混元图像3.0开源榜一,工业级800亿参数可商用,附提示技巧
28日,腾讯开源800亿参数的工业级原生多模态生图模型HunyuanImage 3.0,个人和月活≤1亿公司可免费用。它是全球参数量最大、性能最好的开源图像生成模型,技术强、评估表现优,官方还整理了提示词手册。
1052篇文献!上海AI Lab发布科学LLM综述:从数据基础到Agent前沿
上海AI Lab主导,25家研究机构共同梳理270+训练集、190+评测集,提出科学数据分层框架与智能体闭环科研新范式。还介绍了模型演进、数据情况、评估基准等,指出数据缺陷并展望走向科学家智能体的三步。
企业落地 NL2SQL,需要的是 AI-ready data 和 小模型
当NL2SQL从Demo走向生产,关键是‘更干净的数据底座 + 更小的专用模型 + 更可控的工程化流程’。文章指出先数据后模型,小模型足够用且落地成本低,评估要换维度,还介绍了工程化路径等内容。
Cursor只排第6!136国用户实测25款AI编码工具,第一名73%胜率,还是个新面孔
Design Arena评测平台用对抗式评测方法,让用户对AI模型生成的设计作品投票,评估其设计美学表现。文章总结了上榜的编码工具,如new.website胜率约73%排第一,还对比了不同类型模型的排名情况。
o3 Gemini 都翻车?首个可验证长链 GUI 数据集 VeriGUI 重磅开源,探索通用 Agent 能力边界
GUI 智能体发展遇瓶颈,现有数据集难评估其长时程规划能力。2077AI 开源基金会牵头构建的 VeriGUI 应运而生,有长链复杂性与子任务级可验证性特征,论文登 Hugging Face 月榜第三,还证明现有模型瓶颈。
大模型进入研发体系后,我们看到了这些变化
InfoQ《极客有约》X AICon 直播邀请同程、网易、百度工程师探讨大模型入研发体系的变化。指出其在提效、协作、分工上作用大,还分析了适用场景、工程师收益类型及核心竞争力等,也提及效率评估、代码生成等问题。
硅基流动完成新一轮数亿元融资,打造开发者首选生成式 AI 开发平台
硅基流动完成数亿元 A 轮融资,由阿里云领投。创始人袁进辉称业务因开源大模型崛起和算力需求激增爆发式增长。公司推出高性能推理引擎等,产品服务多个行业,未来将深耕创新、推动 AI 应用。