Phi-3-vision:Phi3家族新视觉成员,小模型大潜力,超越Claude3-Haiku和Gemini1.0-ProV
Phi-3-vision:Phi3家族新视觉成员,小模型大潜力
今年Build大会上,微软悄悄放出了Phi-3家族的首个多模态成员——Phi-3-vision。它不仅能看,还能说,准确地说,是一个同时理解文本和图像、还能从图像中提取文字并进行推理的小模型。目前已经开放试用。

Phi-3家族模型介绍
Phi-3系列一直是微软用小模型撬动大性能的典型代表——用合成教科级数据训练,体积小巧却推理能力出众,在语言、推理、编码和数学基准测试中,都超越了同等大小甚至更大的模型。简单说,就是
小体积、大潜力
加上之前发布的型号,微软已经开放了Phi-3-mini、Phi-3-small、Phi-3-medium和Phi-3-vision四款模型。每一款都经过指令调整,并按照微软的负责任AI与安全标准开发,确保可用性和安全性。
- • :42亿参数的多模态模型,具备语言和视觉能力。
Phi-3-vision
- • :38亿参数的语言模型,提供128K和4K两种上下文长度。
Phi-3-mini
- • :70亿参数的语言模型,提供128K和8K两种上下文长度。
Phi-3-small
- • :140亿参数的语言模型,提供128K和4K两种上下文长度。
Phi-3-medium
这些模型权重已全部开放,在Hugging Face上可以找到上述所有Phi-3模型。同时,它们已在多种硬件上优化,包含ONNX Runtime和DirectML的优化变体,可在移动设备和网络部署上运行,也针对NVIDIA GPU和Intel翻跟斗做了推理优化。
Phi-3-vision多模态LLM
Phi-3-vision是Phi-3家族中的
第一个多模态模型
针对图表和图解的理解做了优化
模型评估:小尺寸大潜力
此前已经看到,Phi-3-small仅7B参数就在各项基准中
击败了GPT-3.5T
超越了Gemini 1.0 Pro
超越了Claude-3 Haiku和Gemini 1.0 Pro V
Phi-3-small评估
Phi-3-medium评估
Phi-3-vision评估
总的来说,Phi-3系列再次证明了小模型的潜力。它将有效降低企业训练微调的成本,实现特定需求的微调训练。加上体积小、推理硬件要求低,特别适合在本地设备部署。由于优秀的推理性能,企业也无需针对这些任务进行大型训练。
具体来说,Phi-3-mini、Phi-3-small和Phi-3-medium可用于内容创作、摘要、问答和情感分析等语言理解和生成任务。它们还具备强大的推理和逻辑能力,加上更大的上下文窗口,能处理和推理大型文本(文档、网页、代码等)。而Phi-3-vision则特别适合需要对图像和文本进行推理的任务,尤其是OCR、图表图解和表格理解等场景。
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名