「智能体任务」共找到 4991 篇相关文章

产品应用8

李飞飞押注的「世界模型」,中国自研Matrix-3D已抢先实现了?

中国自研世界模型Matrix-3D可单张图生成3D世界,效果对标李飞飞的World Labs,还能实现更大范围探索。它有诸多优势,技术上有创新,数据集有特点,应用前景广泛。

新智元
推荐文章7

一个半月高强度 Claude Code :Vibe coding 是一种全新的思维模式

开发者王巍记录使用Claude Code感受与经验。提到Vibe coding是新思维模式,还分享从传统Editor AI转换的体验,以及CC的边界、使用模式、迭代方式等,也谈到其限制与应对策略。

Founder Park
算法论文8

AST | 西交大刘子扬、陈刚等:直接嵌入流场特征的智能化气动外形优化经验学习框架

传统气动外形优化方法有局限,本文提出智能化优化经验学习框架,结合DNN流场预测模型与DRL优化方法,还提出自适应网格再生成技术与Sigmoid奖赏函数,经验证效果良好,为气动优化提供新路径。

力学与人工智能
开源动态8

全模态RAG突破文本局限,港大构建跨模态一体化系统

香港大学黄超教授团队开源多模态智能处理系统RAG - Anything,突破传统RAG技术单一文本局限,整合多模态文档解析等核心能力,解决现有RAG系统痛点,具备多方面技术亮点,有便捷部署方式和多场景应用模式。

量子位
算法论文8

推理正确率下降65.5%!斯坦福、MIT等用「不等式」拷问AI逻辑极限

大语言模型在数学证明常现推理漏洞,斯坦福等高校团队提出IneqMath基准评估其严谨性。用不等式证明题切入,拆解为子任务,构建评测体系,用LLM - as - Judge审查。结果显示模型推理正确率低,存在结构性缺陷。

新智元
推荐文章7

揭秘大模型评测:如何用“说明书”式方法实现业务场景下的精准评估

文章系统性介绍业务场景下大模型评测流程,包括需求分析、评测集设计生成、维度设定、任务执行和报告输出。指出评测挑战,如设计维度和集,还给出评测方法及案例,像蚂蚁评测集、业务自动化评测。

阿里云开发者
开源动态8

MiniMax重磅开源M1模型:百万上下文超DeepSeek R1,实现性能与效率双杀

MiniMax正式开源首个推理模型M1,原生支持百万级上下文长度,在推理效率、计算成本和复杂任务能力上有独特表现。其在性能和效率上超越DeepSeek R1等模型,还提出创新强化学习算法。

AI科技大本营
开源动态8

Gödel Rescheduler:适用于云原生系统的全局最优重调度框架

本文介绍字节跳动研发的Gödel Rescheduler重调度框架,它能解决传统调度资源分配和任务摆放问题。阐述传统重调度弊端,介绍新方案组件,列举应用场景及成果,还提及未来规划,目前已开源。

InfoQ
算法论文7

函数向量对齐技术,让大模型持续学习不“失忆”丨ICLR 2025

中国科学技术大学等校团队破解大语言模型灾难性遗忘之谜,发现遗忘源于模型激活带偏差新功能,非覆盖旧功能。还设计FVG训练法,保留并对齐函数向量,保护模型能力。相关论文被ICLR2025接收,代码开源。

量子位
开源动态7

DeepSeek揭秘o1后,小红书似乎破解了o3的技术路线,还开源了~

OpenAI闭源后,大家不知其先进模型技术路线,解密成重要任务。DeepSeek R1年初开源后引发关注,小红书团队核心贡献的论文似破解o3谜题,还开源模型等,为训练调优提供可行路线。

探索AGI