支持哪些AI模型?RK3588+RK1828边缘AI网关架构与模型生态解析

武汉万象奥科
2026-08-21
来源:

导语:

随着机器视觉、大语言模型和视觉语言模型逐渐进入工业现场,边缘计算设备不仅要运行AI算法,还要同时承担视频解码、设备通信、数据存储、人机交互和远程管理等任务。

RK3588+RK1828边缘AI网关采用双芯异构架构:RK3588负责操作系统、视频处理和业务应用,RK1828通过PCIe提供独立AI推理能力。

从软件栈看,这套平台包含三条AI部署路径:

● RK3588通过RKNN-Toolkit2部署目标检测、分类、分割和OCR等视觉模型。

● RK3588通过RKLLM-Toolkit部署大语言模型和视觉语言模型。

● RK1828通过RKNN3运行环境承担独立的大模型及高负载AI推理任务。

因此,这套平台支持的不只是YOLO或Qwen某个单一模型,而是覆盖传统视觉、自然语言处理和多模态AI的完整部署体系。


01


RK3588与RK1828分别负责什么?



RK3588采用4核Cortex-A76与4核Cortex-A55架构,集成Mali-G610 MP4 GPU、视频编解码单元和最高6 TOPS算力的NPU。

在边缘AI网关中,RK3588主要负责:

● Linux操作系统和业务程序

● 网络相机、USB相机和传感器接入

● H.264、H.265视频编解码

● 图像缩放、裁剪和颜色格式转换

● 机器视觉模型推理

● 轻量化大语言模型推理

● 数据存储与网络通信

● 网页和本地人机界面

● RS485、RS232等工业接口通信

● 告警判断和设备联动

RK1828是一颗独立AI协处理器,通过PCIe与RK3588连接,拥有独立的NPU、运行内存、固件和RKNN3运行环境。

RK1828可以承担:

● 独立的大语言模型推理

● 本地知识问答

● 故障分析与维护建议

● 设备操作助手

● 文档内容分析

● 多模态模型推理

● 更高负载的AI计算任务

这种双芯架构不是简单地把两颗NPU算力相加,而是让系统业务、机器视觉和大模型推理运行在更合适的硬件环境中。


02


RK3588支持哪些视觉模型框架?


RK3588通过RKNN-Toolkit2完成视觉模型转换。

RKNN-Toolkit2支持的模型来源框架包括:

● Caffe

● TensorFlow

● TensorFlow Lite

● ONNX

● Darknet

● PyTorch

以RKNN-Toolkit2 2.3.0为例,其对应的框架版本包括Caffe 1.0、TensorFlow 1.12.0至2.14.0、TensorFlow Lite Schema Version 3、ONNX 1.7.0至1.17.0,以及PyTorch 1.10.1至2.4.0。

RK3588并不是直接运行PyTorch或ONNX模型。开发者需要先在x86计算机上使用RKNN-Toolkit2,将原始模型转换为.rknn格式,再通过板端RKNN Runtime调用NPU完成推理。

视觉模型部署流程如下:

PyTorch、TensorFlow、ONNX等模型                 ↓         RKNN-Toolkit2转换                 ↓             RKNN模型                 ↓       RKNN Runtime加载模型                 ↓          RK3588 NPU推理



03


RK3588适合运行哪些视觉模型?


RKNN Model Zoo提供了MobileNet、YOLO等模型示例。结合RKNN工具链,RK3588可以部署以下类型的视觉模型。


1. 目标检测模型

可以部署YOLO系列、SSD等目标检测网络,用于:

● 工业产品缺陷检测

● 零部件漏装、错装检测

● 人员与车辆识别

● 安全帽和工作服识别

● 区域入侵检测

● 目标计数与跟踪

YOLOv8具有Python和C/C++示例,可以处理图片、H.264/H.265视频和RTSP视频流。


2. 图像分类模型

MobileNet、ResNet等分类网络可用于:

● 产品等级分类

● 物料种类识别

● 设备状态判断

● 图像质量检测

● 异常状态识别


3. OCR模型

OCR模型可以用于:

● 仪表读数识别

● 设备铭牌识别

● 包装字符检测

● 产品序列号识别

● 生产日期和批次号识别


4. 图像分割模型

图像分割模型适用于:

● 表面缺陷区域提取

● 裂纹和污渍检测

● 零部件轮廓分割

● 道路和作业区域识别

● 像素级尺寸测量


5. 人脸与关键点模型

经过RKNN工具链适配后,还可以部署人脸检测、特征提取、人体姿态和关键点检测模型,用于门禁管理、行为分析、机械臂视觉定位等场景。

需要注意,支持某个模型框架不等于该框架下的全部网络都可以直接运行。模型能否部署,还取决于算子兼容性、动态形状、输入尺寸、量化方式和后处理实现。


04


RK3588支持哪些大语言模型?


RK3588不仅能够运行视觉模型,还可以通过RKLLM软件栈部署大语言模型和视觉语言模型。

RKLLM软件栈由三个主要部分组成:

● RKLLM-Toolkit:在PC端进行模型加载、量化、转换和导出。

● RKLLM Runtime:在板端加载RKLLM模型,并提供C/C++推理接口。

● RKNPU驱动:负责与RK3588 NPU硬件交互。

RKLLM-Toolkit支持Hugging Face和GGUF两种主要模型来源。

Hugging Face模型可以是公开下载的开源模型,也可以是用户自行训练、并按照兼容结构保存的模型。

GGUF模型目前支持:

● q4_0

● fp16

经过转换后,模型会导出为

.rkllm

格式,并通过RKLLM Runtime在RK3588 NPU上运行。



05


RKLLM支持哪些LLM和VLM?


RKLLM覆盖多个主流大语言模型与视觉语言模型家族,包括:


语言模型

● LLaMA

● TinyLLaMA

● Qwen

● Qwen2

● Qwen2.5

● Qwen3

● Phi-2

● Phi-3

● ChatGLM3-6B

● Gemma

● Gemma2

● Gemma3

● Gemma3n

● InternLM2

● MiniCPM

● MiniCPM3

● MiniCPM4

● TeleChat2

● DeepSeek-R1-Distill

● RWKV7


视觉语言和多模态模型

● Qwen2-VL

● Qwen3-VL

● MiniCPM-S

● MiniCPM-V-2_6

● Janus-Pro-1B

● InternVL2-1B

● InternVL3

● InternVL3-1B

● SmolVLM

● DeepSeekOCR

模型进入支持列表,并不代表任意参数规模都适合在RK3588上运行。

实际部署时,需要综合考虑:

● 模型参数规模

● 模型权重大小

● 量化方式

● 运行内存

● KV Cache占用

● 上下文长度

● 首Token延迟

● 文本生成速度

● 多模态输入分辨率

对于工业设备助手和本地知识问答,通常应优先选择参数规模较小、经过充分量化的模型。



06


RKLLM支持哪些量化方式?


RKLLM-Toolkit可以将浮点模型量化为定点模型,以减少权重体积和运行内存,提高板端推理效率。

支持的量化类型包括:

● w4a16

● w4a16分组量化

● w8a8

● w8a8分组量化

w4a16分组量化支持:

● 32

● 64

● 128

w8a8分组量化支持:

● 128

● 256

● 512

其中,“w”表示权重精度,“a”表示激活精度。

w4a16可以显著降低模型权重体积,适合内存受限的大语言模型部署;w8a8通常具有更高的数值精度,但模型体积和内存占用也会相应增加。

不同模型对量化的敏感程度不同。正式部署前,需要重新测试:

● 回答质量

● 中文理解能力

● 专业知识准确率

● 指令遵循能力

● 首Token延迟

● Token生成速度

● 内存峰值


07


RKLLM模型如何在RK3588上运行?


RKLLM开发流程主要包括PC端转换和板端运行两个阶段。

PC端转换过程包括:

1. 获取Hugging Face或GGUF模型。

2. 使用rkllm.load_huggingface()或rkllm.load_gguf()加载模型。

3. 使用rkllm.build()配置优化等级和量化类型。

4. 使用rkllm.export_rkllm()导出.rkllm模型。

板端运行过程包括:

1. 使用RKLLM Runtime初始化模型。

2. 设置上下文长度、生成长度和采样参数。

3. 定义回调函数,持续接收推理输出。

4. 将用户输入传递给模型。

5. 通过回调函数实时获取生成结果。

6. 推理结束后释放模型资源。

RKLLM Runtime提供C/C++接口,适合集成到设备管理程序、本地知识库、网页服务和工业应用中。


08


RKNN视觉模型与RKLLM大模型

有什么区别?


RKNN-Toolkit2主要面向传统神经网络模型,例如:

● YOLO目标检测

● MobileNet图像分类

● 图像分割

● OCR

● 人脸识别

● 姿态估计

这类模型通常导出为.rknn文件,并通过RKNN Runtime运行。

RKLLM-Toolkit主要面向大语言模型和视觉语言模型,例如:

● Qwen2.5

● Qwen3

● LLaMA

● DeepSeek-R1-Distill

● Qwen2-VL

● Qwen3-VL

● DeepSeekOCR

这类模型通常导出为.rkllm文件,并通过RKLLM Runtime运行。

两条工具链都可以使用RK3588的NPU,但模型格式、转换流程、板端接口和内存管理方式不同,不能直接混用。


09


RK1828采用什么大模型部署方式?


RK1828通过PCIe与RK3588连接,使用独立的RKNN3运行环境。

RK1828部署套件包含:

● PCIe EP驱动

● RK1828固件

● RKNN3运行库

● GStreamer插件库

● 调试工具集

● RKNN3开机自启服务

RK1828可以通过rkllm3-server运行适配后的Qwen系列模型,例如:

● Qwen2.5-3B

● Qwen3-8B

RK1828模型部署文件通常包括:

模型.rknn模型.tokenizer.gguf模型.embed.bin


这里需要特别区分:

● RK3588的RKLLM工具链导出.rkllm模型。

● RK1828的RKNN3部署方案使用适配后的.rknn模型及配套Tokenizer、Embedding文件。

两者虽然都能运行大语言模型,但不是同一套模型格式和运行环境。


10


RK3588与RK1828如何协同?


以工业巡检为例,整个处理流程可以分为以下阶段。

首先,网络相机和传感器接入RK3588。RK3588完成RTSP拉流、H.264/H.265硬件解码和图像预处理。

随后,RK3588 NPU运行YOLO或OCR模型,识别仪表数据、设备状态、人员行为和异常目标。

完成视觉识别后,RK3588将识别结果、传感器数据和维护资料组织成结构化信息。

对于较轻量的语言模型,可以直接通过RKLLM Runtime在RK3588上完成分析;对于参数规模更大或需要与系统业务隔离的模型,可以将任务提交给RK1828。

大模型可以进一步生成:

● 故障原因说明

● 风险等级判断

● 维护操作建议

● 检修步骤

● 备件需求

● 安全注意事项

最后,RK3588将结果显示在网页或者本地屏幕上,并通过RS485、RS232或网络接口联动PLC、声光报警器和远程管理平台。

整个处理链路如下:

相机与传感器接入        ↓RK3588视频解码与数据采集        ↓RK3588 NPU视觉识别        ↓RK3588 RKLLM或RK1828大模型分析        ↓结果显示、告警与工业设备联动



11


项目应该如何选择部署平台?


如果项目主要运行单路或少量视觉模型,可以优先使用RK3588自带NPU。

如果项目需要运行经过量化的小参数语言模型,同时对响应速度要求不高,可以评估在RK3588上使用RKLLM。

如果项目还需要多路视频、复杂业务程序和大语言模型并行运行,可以通过RK1828将大模型推理从RK3588系统中分离。

选型时应综合评估:

● 视觉模型数量

● 视频输入路数

● LLM参数规模

● 模型量化类型

● 上下文长度

● 内存占用

● 响应速度

● 功耗与散热

● 并发用户数量

● 长期运行稳定性



总结




RK3588+RK1828边缘AI网关并不是只支持某一种AI模型,而是形成了覆盖机器视觉、大语言模型和视觉语言模型的多层次部署能力。

RK3588可以通过RKNN-Toolkit2运行YOLO、MobileNet、OCR等视觉模型,也可以通过RKLLM-Toolkit部署Qwen、LLaMA、DeepSeek-R1-Distill、Qwen-VL和DeepSeekOCR等LLM、VLM模型。

RK1828则通过PCIe和RKNN3运行环境提供独立AI推理能力,可承担Qwen2.5-3B、Qwen3-8B等模型的服务化部署。

双芯架构的真正价值,不是参数表上的算力叠加,而是让视觉识别、大模型推理和工业业务运行在更合适的硬件与软件环境中。


私信或评论“RK3588+RK1828”获取资料

分享
下一篇:这是最后一篇
上一篇:这是第一篇