「PhyT2V框架」共找到 3373 篇相关文章
4.2w颗星!学术科研 AI 工作流
这是一套有4.2w颗星的学术研究技能包,涵盖研究到论文出版全流程。它不替写论文,接手搜文献等杂事。有四个核心skill,支持多文献引用格式,能编译成PDF,还介绍了安装和使用方式。
2w star,网页秒变 AI 助手,厉害了!
阿里项目`PageAgent`登上Github热榜,是纯前端JavaScript GUI智能体框架。它让网页拥有AI Agent,通过自然语言控制界面,无需截图、OCR和多模态大模型,有多种功能特性,使用简单。
2.3K Star 霸榜GitHub!DeepResearch最佳开源平替!
DeepResearch能递归拆解复杂任务自动生成报告,但OpenAI的相关产品费用高且闭源。霸榜GitHub的ROMA由Sentient AGI团队开发,性能超Grok - 4等,是开源杀手,还介绍了功能、使用方法和应用场景。
Qwen2.5VL新玩法,看电影讲故事
本公众号关注AI前沿技术,分享实战案例与课程。介绍视觉叙事技术及挑战,基于Qwen2.5 - VL 7B模型微调Qwen Storyteller,构建StoryReasoning数据集,还给出实战代码及相关链接。
Mistral 3开源,一举超越DeepSeek与K2?
近期,Mistral AI开源Mistral 3,含三款小型稠密模型及Mistral Large 3。Benchmark对比中,它领先国内DeepSeek - 3.1、Kimi - K2。Mistral Large 3是强开源权重模型,Ministral 3适合边缘端,成本性能比低。
2篇论文,最新上下文工程技术一次性讲透!
上下文工程技术持续火热,文章分享10月两篇相关论文。ACE让模型给自己写「战术板」,在多任务表现优;SA - ICL让LLM先搭框架再做题,在化学/物理准确率提升显著,还对二者做了横向对比。
人大-清华-腾讯发布:音频 - 视觉多模态任务统一框架
人大、清华和腾讯合作发布Crab论文,目标是实现多模态场景理解任务的高效一统。它针对音频 - 视觉理解模型难点提出解决方案,构建数据集、设计LoRA结构、统一架构,训练分预训练和指令调整两阶段。
2篇最新论文,把Deep Research讲透了~
阿里开源Tongyi DeepResearch热度高,文章分享两篇相关技术综述。介绍Deep Research是代理研究新范式,阐述其四大核心模块、优化方法、数据处理、奖励机制,还提及开源系统亮点及相关论文。
AI 智能体实践评估:基准、框架与经验总结
文章为将 AI 智能体从原型落地到生产环境的团队提供实用评估框架。指出传统评估不适用于智能体,介绍评估工具,阐述五大评估支柱,还给出基于 Claude 和 LangChain 的评估示例及实践经验。
2亿多人开始和AI打电话,他们在聊什么?
2025年12月豆包月活达2.27亿,越来越多人与它语音通话。此前AI语音交互存在问题,豆包升级为全双工模型,体验更像打电话。作者实测其在不同场景表现出色,还分享使用技巧,并对比了和ChatGPT语音的优劣。