本文由 资源共享网 – ziyuan 发布,转载请注明出处,如有问题请联系我们!多模态统一大模型 Florence-2模型
Florence-2是微软研究院推出的开源多模态统一大模型,采用文本Prompt统一所有计算机视觉任务,在零样本能力上表现突出。
核心特点
任务统一架构:打破传统多任务多模型的设计,用一个纯Transformer架构统一处理目标检测、实例分割、OCR、图像描述、VQA视觉问答、深度估计等数十种CV任务,所有任务都转化为文本生成问题,通过不同Prompt调用即可。
极强零样本迁移能力:在126个公开数据集上做了预训练,覆盖各类视觉任务场景,零样本下直接超越很多专业微调模型,不需要针对特定任务微调就能直接用。
多尺寸适配不同场景:推出了3个参数规格,适配从端侧到云端的不同需求:
表格
核心能力示例
你只需要更换Prompt就能切换任务:
图像描述:
What is the content of this image?目标检测:
<OD>猫会输出所有猫的 bounding box 坐标OCR识别:
<OCR>提取图片中所有文字视觉问答:
How many people are in this image?直接回答问题
与《多模态统一大模型 Florence-2模型》相关的《AI设计》
TripoSR快速3D重建大模型
TripoSR-model.ckpt是TripoAI开源的TripoSR快速3D重建大模型的预训练权重文件,ckpt为传统PyTorch模型存储格式,用于从单张输入图像快速生成高质量三维网格模型。核心定位与特点TripoSR是目前速度最快的开源单图转3D模型,核心优势:生成速度极快:单张图像生成完整3D网格仅需0.5秒,远快于传统NeRF重建方案(通常需要数分钟)精度表现优秀:在复杂...
5 842 0
基于SDXL框架开发的顶级写实风格AI绘画大模型
realvisxlV40_v40Bakedvae.safetensors是基于SDXL框架开发的顶级写实风格AI绘画大模型,已经内置烘焙好的匹配VAE,是目前SDXL生态中最受欢迎的写实底模之一,文件格式为安全的safetensors。核心特点与定位它主打极致照片级真实感,是RealVisXL系列的V4.0稳定版本,核心优势突出:内置匹配的 baked VAE,下载后直接加载即可使用,无需...
5 823 0
AI图像修复&超分辨率放大模型
SUPIR-v0F.ckpt是SUPIR开源AI图像修复放大项目的官方预训练模型权重文件,ckpt格式是传统PyTorch模型权重存储格式,v0F是SUPIR项目针对真实场景优化的正式版本。核心定位与特点SUPIR是目前效果领先的开源AI图像修复&超分辨率放大模型,专门处理老旧照片、低分辨率图像的高清修复,v0F版本核心优势:保留原始图像细节:放大修复后不会过度平滑丢失真实纹理,对老照片的胶...
5 861 0


