​VMware Cloud Foundation 9.1.1下,将轻量终端编码Agent「Pi」对接VCF Private AI Services(PAIS)私有化大模型推理服务;PAIS对外提供OpenAI兼容API端点,企业可在本地私有云运行开源权重大模型,无需消耗公有云Token配额;文章给出完整五步实操流程,包含models.json模型配置样例、环境变量设置、Qwen3.8‑27B模型调参;测试硬件为NVIDIA RTX A4000(20GB显存)运行Q4_K_S量化版Qwen3.8‑27B,实测输出约15token/s;提示机箱散热不足会引发GPU降频、推理吞吐量下降。

VCF‑PAIS提供OpenAI兼容接口,可对接Pi Coding Agent实现本地私有化Agentic‑AI编码能力;五步完成部署,核心编写~/.pi/agent/models.json定义vcf模型提供商;需配置环境变量绕过PAIS自签名证书校验、注入PAIS_API_KEY;测试Qwen3.8‑27B‑Q4_K_S在RTX A4000可达15TPS,GPU散热会显著影响推理速度;整套运行于企业本地VCF私有云,数据不出企业内网。

一、基础信息总览

项目详情
原文作者William Lam(Broadcom VCF杰出平台架构师)
发布日期2026‑09‑17
环境底座VMware Cloud Foundation 9.1.1,VKS(vSphere Kubernetes Service)
服务端组件VCF Private AI Services(PAIS),提供OpenAI‑compatible推理端点,已生成API Token
客户端AgentPi Coding Agent:轻量终端编码Agent框架,多模型提供商适配
测试大模型Qwen3.8‑27B(Q4_K_S GGUF量化版本)
测试GPU硬件NVIDIA RTX A4000 20GB显存
实测推理性能良好散热:~15 token/s;散热不足触发降频TPS明显下跌
核心价值企业内网私有化Agent编码,数据不流出,规避公有云Token消耗与数据合规风险

二、前置硬性要求

  1. VCF环境已经部署PAIS,并且已经生成PAIS模型访问API‑Token;获取PAIS访问Base‑URL。

  2. 运行Pi的本地机器网络可连通PAIS服务端点网络。

  3. Node.js环境,用于运行Pi Coding Agent。

  4. PAIS部署的模型ID必须与models.json配置内model id完全保持一致(案例qwen3.8‑27b)。

三、完整部署5步骤实操解读

  1. 步骤1:本地安装Pi Coding Agent

    在可访问PAIS网络的主机安装Pi,支持npm全局安装。

  2. 步骤2:初始化Pi生成目录结构

    终端直接执行命令 pi,随后按Ctrl+C退出;执行会自动在用户家目录生成 ~/.pi配置目录,存放后续models.json。

  3. 步骤3:编写模型配置文件 ~/.pi/agent/models.json

    定义名称为vcf的provider,填入PAIS的baseUrl、apiKey引用环境变量${PAIS_API_KEY},配置模型id、上下文窗口60000、maxTokens4096,配置reasoning推理等级映射,适配Qwen3.8思考输出格式chat‑template。

    注意:json内model id必须和PAIS服务端部署模型ID严格匹配。

  4. 步骤4:设置Shell环境变量

    • export NODE_TLS_REJECT_UNAUTHORIZED=0:绕过PAIS自签名TLS证书校验,仅内部测试环境使用,生产环境建议部署可信CA证书,不要关闭证书校验。

    • export PAIS_API_KEY="PAIS生成的真实token字符串":models.json中${PAIS_API_KEY}读取该环境变量。

  5. 步骤5:启动Pi并指定vcf提供商+模型

    执行命令:pi --model vcf/qwen3.8‑27b,完成Pi Agent对接PAIS私有化大模型,即可在终端执行编码Agent交互。

四、关键配置说明(models.json片段要点)

  • baseUrl:PAIS OpenAI兼容接口地址示例:https://model.vcf.lab/api/v1/compatibility/openai/v1

  • api:"openai‑completions":声明使用OpenAI兼容完成式接口。

  • contextWindow:60000:Agent可用上下文窗口;maxTokens:4096单轮最大输出token。

  • thinkingLevelMap:将Pi内部推理等级映射给Qwen3.8模型的reasoning_effort参数,适配深度思考输出。

  • chatTemplateKwargs:传递enable_thinking、reasoning_effort,控制Qwen的深度思考开关与思考强度。

五、测试硬件与性能观察

  • 硬件:RTX A4000 20GB,运行Qwen3.8‑27B‑UD‑Q4_K_S量化GGUF模型。

  • 理想散热:推理速度约15 token/s,满足编码Agent交互式使用。

  • 坑点:Mini‑PC(Minisforum MS‑A2)机箱内部散热差,GPU触发thermal throttling热节流,TPS显著下降;建议改善机箱风道或迁移到散热更好的GPU主机。

  • 工具参考:文中提及Local‑Model‑Explorer工具,可快速评估硬件能够承载哪些大模型。

六、风险与生产环境注意事项

  • ⚠️ NODE_TLS_REJECT_UNAUTHORIZED=0仅测试内网环境临时方案;生产环境禁止关闭TLS证书校验,给PAIS部署受信任CA签发证书。

  • ⚠️ API密钥通过环境变量注入,不要明文硬编码写入models.json配置文件,防止密钥泄露。

  • ⚠️ model id必须和PAIS后端部署模型ID完全一致,否则报404模型找不到。

  • ⚠️ Pi为终端Agent框架,仅负责调用推理API;大模型推理负载消耗在PAIS/VCF‑VKS侧GPU资源。

七、高频问答

Q1:Pi Coding Agent是运行在VCF服务器端吗? A:不是,Pi运行在本地客户端机器;客户端通过网络调用VCF‑PAIS私有云上面的大模型推理服务。

Q2:为什么要设置thinkingLevelMap? A:Pi内部推理等级参数和Qwen3.8的reasoning_effort参数命名不完全对齐;该映射完成参数翻译,控制模型深度思考输出。

Q3:能否更换其他开源模型而不是Qwen3.8‑27B? A:可以;只要PAIS部署该模型,在models.json修改model id、contextWindow、maxTokens、thinking映射参数即可。

Q4:关闭NODE_TLS_REJECT_UNAUTHORIZED有什么替代方案? A:把PAIS服务的自签名根证书导入运行Pi的Node系统信任证书链,不关闭证书校验实现安全访问。

Q5:这个架构解决什么业务痛点? A:企业不希望代码、提示词流出到公有AI服务商;整套推理运行在内部VCF私有云,实现内网本地Agentic‑AI编码助手。

全文总结

博文演示VCF9.1.1环境,使用Pi Coding Agent对接VCF PAIS私有AI推理服务;PAIS对外暴露OpenAI兼容API端点,让企业在私有云运行Qwen3.8‑27B等开源大模型,构建内网私有化编码Agent;完整流程包含安装Pi、初始化生成配置目录、编写models.json模型提供商配置、注入PAIS API‑Token环境变量、启动Pi指定vcf/qwen3.8‑27b模型;测试RTX A4000(20GB)运行Q4_K_S量化版本可输出约15token/s,GPU散热会明显影响推理性能;测试使用NODE_TLS_REJECT_UNAUTHORIZED绕过自签名证书仅适合实验环境,生产环境需要部署可信证书;整套方案实现企业内网Agentic‑AI,业务数据不出私有云,规避公有云token消耗与数据合规风险。

Logo

有“AI”的1024 = 2048,欢迎大家加入2048 AI社区

更多推荐