VCF9.1.1:Pi Coding Agent对接VCF私有AI服务PAIS实操完整解析
VMware Cloud Foundation 9.1.1下,将轻量终端编码Agent「Pi」对接VCF Private AI Services(PAIS)私有化大模型推理服务;PAIS对外提供OpenAI兼容API端点,企业可在本地私有云运行开源权重大模型,无需消耗公有云Token配额;文章给出完整五步实操流程,包含models.json模型配置样例、环境变量设置、Qwen3.8‑27B模型调参;测试硬件为NVIDIA RTX A4000(20GB显存)运行Q4_K_S量化版Qwen3.8‑27B,实测输出约15token/s;提示机箱散热不足会引发GPU降频、推理吞吐量下降。
VCF‑PAIS提供OpenAI兼容接口,可对接Pi Coding Agent实现本地私有化Agentic‑AI编码能力;五步完成部署,核心编写~/.pi/agent/models.json定义vcf模型提供商;需配置环境变量绕过PAIS自签名证书校验、注入PAIS_API_KEY;测试Qwen3.8‑27B‑Q4_K_S在RTX A4000可达15TPS,GPU散热会显著影响推理速度;整套运行于企业本地VCF私有云,数据不出企业内网。
一、基础信息总览
| 项目 | 详情 |
|---|---|
| 原文作者 | William Lam(Broadcom VCF杰出平台架构师) |
| 发布日期 | 2026‑09‑17 |
| 环境底座 | VMware Cloud Foundation 9.1.1,VKS(vSphere Kubernetes Service) |
| 服务端组件 | VCF Private AI Services(PAIS),提供OpenAI‑compatible推理端点,已生成API Token |
| 客户端Agent | Pi Coding Agent:轻量终端编码Agent框架,多模型提供商适配 |
| 测试大模型 | Qwen3.8‑27B(Q4_K_S GGUF量化版本) |
| 测试GPU硬件 | NVIDIA RTX A4000 20GB显存 |
| 实测推理性能 | 良好散热:~15 token/s;散热不足触发降频TPS明显下跌 |
| 核心价值 | 企业内网私有化Agent编码,数据不流出,规避公有云Token消耗与数据合规风险 |
二、前置硬性要求
-
VCF环境已经部署PAIS,并且已经生成PAIS模型访问API‑Token;获取PAIS访问Base‑URL。
-
运行Pi的本地机器网络可连通PAIS服务端点网络。
-
Node.js环境,用于运行Pi Coding Agent。
-
PAIS部署的模型ID必须与models.json配置内model id完全保持一致(案例qwen3.8‑27b)。
三、完整部署5步骤实操解读
-
步骤1:本地安装Pi Coding Agent
在可访问PAIS网络的主机安装Pi,支持npm全局安装。
-
步骤2:初始化Pi生成目录结构
终端直接执行命令
pi,随后按Ctrl+C退出;执行会自动在用户家目录生成~/.pi配置目录,存放后续models.json。 -
步骤3:编写模型配置文件 ~/.pi/agent/models.json
定义名称为vcf的provider,填入PAIS的baseUrl、apiKey引用环境变量${PAIS_API_KEY},配置模型id、上下文窗口60000、maxTokens4096,配置reasoning推理等级映射,适配Qwen3.8思考输出格式chat‑template。
注意:json内model id必须和PAIS服务端部署模型ID严格匹配。
-
步骤4:设置Shell环境变量
-
export NODE_TLS_REJECT_UNAUTHORIZED=0:绕过PAIS自签名TLS证书校验,仅内部测试环境使用,生产环境建议部署可信CA证书,不要关闭证书校验。 -
export PAIS_API_KEY="PAIS生成的真实token字符串":models.json中${PAIS_API_KEY}读取该环境变量。
-
-
步骤5:启动Pi并指定vcf提供商+模型
执行命令:
pi --model vcf/qwen3.8‑27b,完成Pi Agent对接PAIS私有化大模型,即可在终端执行编码Agent交互。
四、关键配置说明(models.json片段要点)
-
baseUrl:PAIS OpenAI兼容接口地址示例:https://model.vcf.lab/api/v1/compatibility/openai/v1 -
api:"openai‑completions":声明使用OpenAI兼容完成式接口。 -
contextWindow:60000:Agent可用上下文窗口;maxTokens:4096单轮最大输出token。 -
thinkingLevelMap:将Pi内部推理等级映射给Qwen3.8模型的reasoning_effort参数,适配深度思考输出。 -
chatTemplateKwargs:传递enable_thinking、reasoning_effort,控制Qwen的深度思考开关与思考强度。
五、测试硬件与性能观察
-
硬件:RTX A4000 20GB,运行Qwen3.8‑27B‑UD‑Q4_K_S量化GGUF模型。
-
理想散热:推理速度约15 token/s,满足编码Agent交互式使用。
-
坑点:Mini‑PC(Minisforum MS‑A2)机箱内部散热差,GPU触发thermal throttling热节流,TPS显著下降;建议改善机箱风道或迁移到散热更好的GPU主机。
-
工具参考:文中提及Local‑Model‑Explorer工具,可快速评估硬件能够承载哪些大模型。
六、风险与生产环境注意事项
-
⚠️
NODE_TLS_REJECT_UNAUTHORIZED=0仅测试内网环境临时方案;生产环境禁止关闭TLS证书校验,给PAIS部署受信任CA签发证书。 -
⚠️ API密钥通过环境变量注入,不要明文硬编码写入models.json配置文件,防止密钥泄露。
-
⚠️ model id必须和PAIS后端部署模型ID完全一致,否则报404模型找不到。
-
⚠️ Pi为终端Agent框架,仅负责调用推理API;大模型推理负载消耗在PAIS/VCF‑VKS侧GPU资源。
七、高频问答
Q1:Pi Coding Agent是运行在VCF服务器端吗? A:不是,Pi运行在本地客户端机器;客户端通过网络调用VCF‑PAIS私有云上面的大模型推理服务。
Q2:为什么要设置thinkingLevelMap? A:Pi内部推理等级参数和Qwen3.8的reasoning_effort参数命名不完全对齐;该映射完成参数翻译,控制模型深度思考输出。
Q3:能否更换其他开源模型而不是Qwen3.8‑27B? A:可以;只要PAIS部署该模型,在models.json修改model id、contextWindow、maxTokens、thinking映射参数即可。
Q4:关闭NODE_TLS_REJECT_UNAUTHORIZED有什么替代方案? A:把PAIS服务的自签名根证书导入运行Pi的Node系统信任证书链,不关闭证书校验实现安全访问。
Q5:这个架构解决什么业务痛点? A:企业不希望代码、提示词流出到公有AI服务商;整套推理运行在内部VCF私有云,实现内网本地Agentic‑AI编码助手。
全文总结
博文演示VCF9.1.1环境,使用Pi Coding Agent对接VCF PAIS私有AI推理服务;PAIS对外暴露OpenAI兼容API端点,让企业在私有云运行Qwen3.8‑27B等开源大模型,构建内网私有化编码Agent;完整流程包含安装Pi、初始化生成配置目录、编写models.json模型提供商配置、注入PAIS API‑Token环境变量、启动Pi指定vcf/qwen3.8‑27b模型;测试RTX A4000(20GB)运行Q4_K_S量化版本可输出约15token/s,GPU散热会明显影响推理性能;测试使用NODE_TLS_REJECT_UNAUTHORIZED绕过自签名证书仅适合实验环境,生产环境需要部署可信证书;整套方案实现企业内网Agentic‑AI,业务数据不出私有云,规避公有云token消耗与数据合规风险。
更多推荐


所有评论(0)