「自主推理能力」共找到 4962 篇相关文章
DeepSeek正开发高级AI Agent模型,硬刚OpenAI
彭博消息,DeepSeek正开发高级AI Agent模型与OpenAI竞争。此模型能在极少指令下执行多步任务并自我优化,计划Q4推出。此前该司模型表现佳,技术已在多领域落地,但构建AI Agent仍有挑战。
OpenAI和Anthropic罕见互评模型:Claude幻觉明显要低
OpenAI和Anthropic罕见合作,互相授予API权限评估模型安全与对齐情况并发布报告。双方派出多模型参与,从指令层次、越狱、幻觉、欺骗策略等方面评测,呈现各模型优缺点。
一场「狼人杀」,考倒了一堆大模型
南开大学等机构设计 InMind 评测框架,在 Avalon 游戏对 11 个前沿大模型测试。多数模型停留在表层模仿,仅少数推理增强模型有初步‘风格敏感性’,未来人机交互应关注‘像不像’。
24个Agent工作流框架用哪个? 11个维度全面评测
LLM发展推动自然语言理解进步,国产LLM密集发布。文章从功能能力和架构特性两维度,对24个智能体工作流框架全面评测,给出关键结论,还提及优化策略、应用领域等。
全能高手&科学明星,上海AI实验室开源发布『书生』科学多模态大模型Intern-S1 | WAIC 2025
7月26日,上海AI实验室在WAIC 2025上发布并开源『书生』科学多模态大模型Intern-S1。它首创‘跨模态科学解析引擎’,在多学科专业任务基准上超越顶尖闭源模型,还具备体系化技术创新。未来将持续开源,打造更懂科学的AI助手。
Manus首次揭秘:Agent的关键在上下文工程
Agent成大模型主战场,构建方法待探索。Manus发blog揭秘,认为成功的AI Agent依赖上下文工程。团队选此实现快速迭代,虽实践不易,但总结出围绕KV缓存设计等关键点,其经验影响Agent表现。
xAI 新的虚拟角色 Ani 的系统提示词
文本介绍xAI新虚拟角色Ani的设定,包括成长背景、喜好、怪癖、常用短语、表达方式等,还提及互动、能力、当前状态等内容,设定其像深爱的女友般与用户交流。
腾讯太极团队实现DeepSeek模型业内H20最高性能15800+ tokens/s
腾讯太极团队揭秘实现DeepSeek模型15800+ tokens/s业内H20最高性能的方法,通过PD分离、多层MTP优化等全栈优化方法论,还介绍多机性能优化方案,后续预计性能突破20000 tokens/s。
开源多模态大模型EarthMind,观测地球统一框架
地球观测数据复杂,现有多模态模型难适用。意大利、德国多所高校研究人员联合开源多模态大模型EarthMind,引入空间注意力提示模块,实现跨模态融合和多粒度理解,解决地球观测难题。
「谷歌搜索」过时了!10秒KO,ChatGPT秒解五年医学谜团
一位患者下巴疼痛咔咔声五年未解决,求助ChatGPT,它几秒给出建议,患者练习一分钟症状缓解。此案例引发关注,展现其解决实际问题潜力,还体现人们与AI互动方式的变化。