AI 新范式:模型即服务 -> MaaS 开放平台-GLM-4-AllTools(硬核干货)
之前我们体验过不少AI大模型在用户侧的能力,从一键生成PPT、Excel,到文生图、文生视频,效率确实惊人。但换个角度,如果以开发者视角来看这些模型,又会是怎样一番光景?今天我们就聚焦智谱的MaaS开放平台(bigmodel.cn),重点聊聊其中的GLM-4-AllTools模型——它如何把图片理解、联网搜索、代码解释、绘图等多种工具整合到一起,实现更复杂的任务。
通过bigmodel.cn网页端即可访问,以下是对该平台和模型的实际探索。
大模型 GLM-4 简介
在MaaS开放平台的【开发文档】菜单下进入【通用大模型】栏目,可以看到可供调用的模型API集合。主要分为几个系列:
1、GLM-4 系列
模型编码:glm-4-0520、glm-4、glm-4-air、glm-4-airx、glm-4-flash
2、GLM-4V 系列
模型编码:glm-4v
3、GLM-4-AllTools
模型编码:glm-4-alltools
AllTools顾名思义,集成了多种工具调用能力,下面通过三个具体例子来感受它的实际表现。
AI 图片理解&情景分析
示例 CASE-1
给定一张带有天空、白云、海面、树木的图片,进行图片情景识别。
在编辑器中提供图片地址(url)以及查询指令(query):
1、输入:
query:图里有什么?
2、输出:
result:图中有一片湛蓝的海面、蓝天白云和岩石上的树木。
海面波光粼粼,反射着太阳光;
天空中的云朵延展而蓬松,呈现出不同的形状和大小;
海岸边的岩石崎岖不平,上面生长着一些坚韧的植物。
从输出可以看出,模型不仅识别出蓝天、白云、海面、树木这些显性元素,连云朵的形状、海面的反光细节都准确捕捉——视觉理解能力相当扎实。
AI 股市查询&实时资讯
示例 CASE-2
针对“2024纳斯达克100指数冲击20000点”这一现象,让模型分析其产生根源。这里需要启用流式输出(stream=True),支持SSE标准,逐块返回生成内容,结束时会有 data: [DONE] 消息。
模型可选择的工具类型包括:
1)function
2)code_interpreter
3)drawing_tool
4)web_browser
实际测试中,GLM-4-AllTools准确理解了指令,调用web_browser获取了纳斯达克100冲上20000点的实时资讯,并给出了分析。工具的选择完全符合预期。
<iframe data-vidtype="2" data-mpvid="wxv_3545567042173616128" data-cover="http%3A%2F%2Fmmbiz.qpic.cn%2Fsz_mmbiz_jpg%2FgphOCPdHkkuVK6WmRIrI7CU3QKYKOVE9oBDia3LWPibib08MbMfQhoWdUfjcxgMb25gzgLBVXXiaDQl4xngibWMfr9g%2F0%3Fwx_fmt%3Djpeg" allowfullscreen="" frameborder="0" data-ratio="1.7777777777777777" data-w="1920" src="https://mp.weixin.qq.com/mp/readtemplate?t=pages/video_player_tmpl&action=mpvideo&auto=0&vid=wxv_3545567042173616128"></iframe>AI 天气预测&文生图
示例 CASE-3
输入指令:“帮我查询深圳07/21至07/26的天气情况,根据天气情况和深圳的著名地标,画一张高质量的城市风景海报。” 模型依次调用了web_browser获取天气数据,再调用drawing_tool生成海报,整个过程一气呵成。
<iframe data-vidtype="2" data-mpvid="wxv_3545612136327102466" data-cover="http%3A%2F%2Fmmbiz.qpic.cn%2Fsz_mmbiz_jpg%2FgphOCPdHkkuVK6WmRIrI7CU3QKYKOVE9m45DlibHiaObgqBibVH265jHrCjpgMegkAarjeTkntjFib06TQpycxDiciaw%2F0%3Fwx_fmt%3Djpeg" allowfullscreen="" frameborder="0" data-ratio="1.7777777777777777" data-w="1920" src="https://mp.weixin.qq.com/mp/readtemplate?t=pages/video_player_tmpl&action=mpvideo&auto=0&vid=wxv_3545612136327102466"></iframe>通过drawing_tool,模型可以根据文本描述生成高质量、高分辨率的图片,支持多种风格,满足各类绘图需求。除了web_browser和drawing_tool,模型还具有增强的函数调用能力(Function Call),允许AI助手调用外部函数,执行特定任务或获取必要数据,实现与外部系统的无缝集成。
<iframe data-vidtype="2" data-mpvid="wxv_3545679611269955585" data-cover="http%3A%2F%2Fmmbiz.qpic.cn%2Fsz_mmbiz_jpg%2FgphOCPdHkkuVK6WmRIrI7CU3QKYKOVE9M5VXv7jED0xEqBS56ekcn0D3puJTYnwU3nx5j6uZSy3gv69u8T7KEg%2F0%3Fwx_fmt%3Djpeg" allowfullscreen="" frameborder="0" data-ratio="1.7777777777777777" data-w="1920" src="https://mp.weixin.qq.com/mp/readtemplate?t=pages/video_player_tmpl&action=mpvideo&auto=0&vid=wxv_3545679611269955585"></iframe>尤为关键的一点:可以清晰地看到模型推理响应的完整过程,每一步工具调用和中间结果都有迹可循,这对于调试和开发来说非常有价值。
从这三个示例可以看出,GLM-4-AllTools将多种工具能力融为一体,让开发者只需通过一套API就能实现复杂的工作流——从图片理解、实时信息查询到天气数据获取、图像生成,都能在一个模型调度下完成。这种“All-in-One”的方式,确实简化了传统多模型、多API串联的繁琐工作。
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名