「大语言模型评估」共找到 8305 篇相关文章
不愁了!开源智能体Paper2Poster「一键生成」学术海报
2025年5月,滑铁卢大学等团队发布Paper2Poster系统,用大模型将论文自动生海报。它提出PosterAgent多智能体方法,分解析、规划、绘制优化三阶段,生成效果好且开源,不过也存在效率和创意不足问题。
AIAAJ | 西工大张巧、张伟伟等:多专家特征融合网络架构预测跨声速抖振气动噪声
为解决气动噪声数据中流动状态与空间位置分布不平衡导致的MLP预测精度不足问题,本研究提出多专家特征融合网络架构,以跨声速抖振气动噪声为算例评估,可降低MLP算法MSE,泛化性更好。
Figure机器人分拣快递新视频曝光,网友:太像人类
Figure 02机器人开启打工模式,创始人放出其分拣快递新视频,它动作流畅像人类,由端到端通用控制模型Helix自主驱动。此前它还在宝马生产线连续20小时轮班作业,Figure与OpenAI分道扬镳后推出Helix。
论文秒变海报!开源框架PosterAgent一键生成顶会级学术Poster
本文介绍开源框架PosterAgent,它能一键将论文转为可编辑的学术海报。相比GPT - 4o,其生成指标优、token使用量少、成本低。研究团队构建评估标准Paper2Poster,实验显示PosterAgent在多方面表现出色。
Karpathy教你值回ChatGPT 200刀「票价」,初创工程师揭秘ChatGPT最核心能力
AI大神Andrej Karpathy用一张图教你选ChatGPT模型,给出使用指南,如简单问题用4o,困难问题用o3等。初创工程师Eric Hayes揭秘其背后复杂记忆系统,含保存记忆、聊天历史等,提升了用户体验。
超越 GoF:现代 AI 系统实用设计模式
文章指出AI系统需要设计模式,如GoF塑造软件设计,云计算引入新模式,机器学习社区也有相关模式。文中介绍现代AI系统的5类实用设计模式,含提示和上下文、负责任的AI、用户体验、AI - Ops和优化模式等,并举例说明。
MCP客户端调用看这一篇就够了(Java版)
文章介绍MCP客户端调用方法,先阐述没MCP时的痛点,再讲大模型调用MCP的姿势,包括Spring - AI和Spring - AI - Alibaba框架的使用,还介绍原生SDK调用方式,记录踩坑问题,探讨两种技术路线的选型。
追忆左耳朵耗子
本文追忆技术人左耳朵耗子,讲述其创业故事,包括创业契机、方向选择等,还分享技术见解,如选技术语言、积累技术等,探讨成长问题,如996、大小公司权衡等,最后推荐书籍并谈对年龄危机看法。
Anthropic首次启动员工股票回购,估值615亿美元
Theinformation消息,大模型平台Anthropic推出首个员工股票回购计划,面向工作至少两年的现任和前任员工,最多可售20%股权,每股56.09美元,公司估值615亿美元。此计划预计月底完成,方式独特,优势明显。
别再卷数据了,LLM也怕「过劳死」!CMU等揭秘灾难性过度训练
CMU、斯坦福等四大名校研究团队挑战“预训练规模越大越好”观点,提出“灾难性过度训练”现象,即增加预训练数据可能导致后训练性能下降,并从现实证据、控制实验、理论分析等方面阐述新研究贡献,还介绍了相关实验及结论。