本文由 资源共享网 – ziyuan 发布,转载请注明出处,如有问题请联系我们!多模态统一大模型 Florence-2模型
Florence-2是微软研究院推出的开源多模态统一大模型,采用文本Prompt统一所有计算机视觉任务,在零样本能力上表现突出。
核心特点
任务统一架构:打破传统多任务多模型的设计,用一个纯Transformer架构统一处理目标检测、实例分割、OCR、图像描述、VQA视觉问答、深度估计等数十种CV任务,所有任务都转化为文本生成问题,通过不同Prompt调用即可。
极强零样本迁移能力:在126个公开数据集上做了预训练,覆盖各类视觉任务场景,零样本下直接超越很多专业微调模型,不需要针对特定任务微调就能直接用。
多尺寸适配不同场景:推出了3个参数规格,适配从端侧到云端的不同需求:
表格
核心能力示例
你只需要更换Prompt就能切换任务:
图像描述:
What is the content of this image?目标检测:
<OD>猫会输出所有猫的 bounding box 坐标OCR识别:
<OCR>提取图片中所有文字视觉问答:
How many people are in this image?直接回答问题
与《多模态统一大模型 Florence-2模型》相关的《AI设计》
基于SD 1.5训练的二次元风格AI绘画大模型
meinamix_meinaV11.safetensors是基于SD 1.5训练的二次元风格AI绘画大模型,是MeinaMix系列的经典成熟版本,文件格式为安全的safetensors。核心定位与特点它主打精美好看的二次元动漫风格生成,对日系动漫脸、萌系角色、插画质感的还原度非常高,是目前二次元创作领域使用最广泛的大模型之一:对动漫人体结构、五官比例的控制更稳定,翻车率远低于早期二次元模型;擅长...
5 444 0
SD1.5官方基础大模型
SD1.5官方基础大模型是Stable Diffusion生态中应用最广泛的基础模型,是绝大多数第三方SD模型的训练基底。核心基础信息发布时间与定位:2022年10月正式发布,是SD 1.x系列的成熟稳定版本,目前仍是社区生态最完善的基础模型。训练规格:基于512×512分辨率图像训练,通过先生成低分辨率再 upscale 的方式也支持更高分辨率出图,显存要求低,消费级显卡即可流畅...
5 457 0
基于SD 1.5训练的半写实融合大模型
revAnimated_v122EOL.safetensors是基于SD 1.5训练的半写实融合大模型,是RevAnimated家族的1.2.2最终维护版本(EOL=End of Life,即停止更新的终版),文件格式为安全的safetensors。核心特点与定位它是模型融合工艺的经典作品,平衡了写实基底模型的细节表现力与二次元模型的风格化表现力,主打"半写实不卡通"的出图风格,是目前SD生态中...
5 483 0


