「简历解析框架」共找到 1864 篇相关文章
Knowledge还是Reasoning?具体分析LLM答案正确,不代表思考过程靠谱的问题
斯坦福/加州大学团队指出大模型答案正确不代表思考过程靠谱,传统评估忽略思考路径问题。团队提出双维度评估框架,透视模型思考过程,还测试发现不同领域决胜关键、最佳训练法不同,且框架正解锁新场景。
单卡4090也能高质量视频编辑!西湖AGI Lab无训练框架FlowDirector来了
视频编辑门槛高、现有方法开销大且效果不佳。西湖大学AGI Lab团队提出无需训练的FlowDirector框架,可将基于流的视频生成模型改造成编辑工具,质量高、功能广、开销低,解决了时序、结构和编辑幅度问题。
刚刚,百度最新开源神作:PaddleOCR-VL-1.5上线了
1月29日百度开源新一代文档解析模型PaddleOCR-VL-1.5,参数仅0.9B,在OmniDocBench V1.5评测中综合性能全球第一,精度达94.5%。它支持异形框定位,解决真实文档解析难题,在多场景表现出色。
AI读网页,这次真不一样了,谷歌Gemini解锁「详解网页」新技能
谷歌在Gemini API上线URL Context功能,能让Gemini模型访问并处理URL内容。与普通扔链接给AI不同,它可深度完整解析文档。有深度解析PDF等能力,被指或成RAG替代方案,也有能力边界。
用两个简单模块实现分割理解双重SOTA!华科大白翔团队等推出多模态新框架
华中科技大学和金山办公团队联合提出语义增强特征提取器(SEFE)和交错局部视觉耦合(ILVC)模块,构建多模态大模型LIRA,解决现有模型分割不精确和理解有幻觉问题,在分割和理解任务上达SOTA。
支付宝 AI 出行助手高效研发指南:4 人团队的架构迁移与提效实战
本文介绍支付宝AI出行助手研发历程,其集成多种出行功能,基于xUI + KMP框架搭建。分享研发实践、挑战与策略,如迁移基础能力、卡片生态,适配标准框架,还提及KMP应用及数据度量体系,取得业务和研发效能成果。
从Transformer到Agent:生成式AI行业技术路线与职业发展指南,深度解析AI价值链
文章深度解析生成式AI行业,介绍其宏观图景、商业运作、行业定位与战略考量。指出行业价值链呈“杠铃”形态,应用层机会大,还提及盈利模式、岗位薪酬、开源闭源之争等,为从业者提供职业指南。
阿里通义的视觉RAG革命!VRAG-RL:基于强化学习的视觉感知RAG框架,性能飙升30%
阿里巴巴通义实验室推出VRAG - RL,融合视觉感知、多模态推理与强化学习,已在GitHub开源。它破解传统RAG处理视觉数据难题,通过创新机制提升性能,在多数据集表现出色,还将向更拟人化和低幻觉方向发展。
首次实现第一视角视频与人体动作同步生成!新框架攻克视角-动作对齐两大技术壁垒
新加坡国立大学等联合发布EgoTwin,首次实现第一视角视频与人体动作联合生成,攻克视角 - 动作对齐与因果耦合瓶颈。它基于扩散模型,通过三大创新设计解决核心难题,实验性能超基线,为多领域应用提供落地基座。
AST | 西交大牛笑天、陈刚等:基于多尺度网格融合技术的复杂三维构型流场时空智能推理方法
文章针对复杂三维外形的强非线性非定常流场推理难题,提出MSGF数据预处理方法与DTECAU - 3D模型联合框架。MSGF解决数据提取难题,DTECAU - 3D解决传统U - net问题,经测试验证该框架效果良好。