首页 > 教程攻略 > ai资讯 >Phi-3-vision:Phi3家族新视觉成员,小模型大潜力,超越Claude3-Haiku和Gemini1.0-ProV

Phi-3-vision:Phi3家族新视觉成员,小模型大潜力,超越Claude3-Haiku和Gemini1.0-ProV

来源:互联网 时间:2026-08-07 14:40:16

Phi-3-vision:Phi3家族新视觉成员,小模型大潜力

今年Build大会上,微软悄悄放出了Phi-3家族的首个多模态成员——Phi-3-vision。它不仅能看,还能说,准确地说,是一个同时理解文本和图像、还能从图像中提取文字并进行推理的小模型。目前已经开放试用。

Phi-3-vision:Phi3家族新视觉成员,小模型大潜力,超越Claude3-Haiku和Gemini1.0-ProV

Phi-3家族模型介绍

Phi-3系列一直是微软用小模型撬动大性能的典型代表——用合成教科级数据训练,体积小巧却推理能力出众,在语言、推理、编码和数学基准测试中,都超越了同等大小甚至更大的模型。简单说,就是

小体积、大潜力

加上之前发布的型号,微软已经开放了Phi-3-mini、Phi-3-small、Phi-3-medium和Phi-3-vision四款模型。每一款都经过指令调整,并按照微软的负责任AI与安全标准开发,确保可用性和安全性。

  • Phi-3-vision

    :42亿参数的多模态模型,具备语言和视觉能力。
  • Phi-3-mini

    :38亿参数的语言模型,提供128K和4K两种上下文长度。
  • Phi-3-small

    :70亿参数的语言模型,提供128K和8K两种上下文长度。
  • Phi-3-medium

    :140亿参数的语言模型,提供128K和4K两种上下文长度。

这些模型权重已全部开放,在Hugging Face上可以找到上述所有Phi-3模型。同时,它们已在多种硬件上优化,包含ONNX Runtime和DirectML的优化变体,可在移动设备和网络部署上运行,也针对NVIDIA GPU和Intel翻跟斗做了推理优化。

Phi-3-vision多模态LLM

Phi-3-vision是Phi-3家族中的

第一个多模态模型

,结合了文本与图像视觉功能,能对现实世界图像进行推理,从图像中提取文本并推理。它

针对图表和图解的理解做了优化

,可用于生成数据洞见和回答问题。Phi-3-vision在Phi-3-mini的基础上构建,继续延续“小模型大潜力”的路线。

模型评估:小尺寸大潜力

此前已经看到,Phi-3-small仅7B参数就在各项基准中

击败了GPT-3.5T

,Phi-3-medium以14B参数

超越了Gemini 1.0 Pro

。现在Phi-3-vision凭4.2B参数,在通用视觉推理任务、OCR、表格和图表理解任务中

超越了Claude-3 Haiku和Gemini 1.0 Pro V

这样的更大模型。

Phi-3-small评估

Phi-3-medium评估

Phi-3-vision评估

总的来说,Phi-3系列再次证明了小模型的潜力。它将有效降低企业训练微调的成本,实现特定需求的微调训练。加上体积小、推理硬件要求低,特别适合在本地设备部署。由于优秀的推理性能,企业也无需针对这些任务进行大型训练。

具体来说,Phi-3-mini、Phi-3-small和Phi-3-medium可用于内容创作、摘要、问答和情感分析等语言理解和生成任务。它们还具备强大的推理和逻辑能力,加上更大的上下文窗口,能处理和推理大型文本(文档、网页、代码等)。而Phi-3-vision则特别适合需要对图像和文本进行推理的任务,尤其是OCR、图表图解和表格理解等场景。