登录社区云,与社区用户共同成长
邀请您加入社区
1.编辑完成后按ESC退出编辑模式
2.同时按下shift和: 冒号组合键进入命令行
3.按w是保存 按wq是保存并退出 按wq!是强制保存并退出
有“AI”的1024 = 2048,欢迎大家加入2048 AI社区
更多推荐
HF Qwen3 模型转 GGUF 实操笔记(llama.cpp 纯Python转换,无需编译)
无需编译 llama.cpp:本流程是纯Python脚本转换,不需要cmake编译后端,Windows上手门槛低;不需要GPU:torch仅用于加载 safetensors 权重文件,CPU即可跑;流式读写:大模型转换不会一次性把全部权重塞进内存,内存压力小;示例1.2GB模型,转换耗时约6秒;GGUF是自包含单文件:权重、分词器、对话模板、特殊token全部打包在一个.gguf内,拷贝即可在ll
英伟达等提出EvoSafeHarness,为不同AI Agent自动定制安全防线,攻击成功率从45.6%降至10.0%
AI Infra
KV = 2 × layers × heads × head_dim × seq_len × batch × 精度。KV ≈ 2 × layers × hidden × seq_len × batch × 2 字节。vLLM 把 KV Cache 分成固定大小的 block,像操作系统分页一样管理,显存降 4 倍(Adam 有 2 个动量 + 1 个方差 + fp32 主权重)。传统 KV Cac
扫一扫分享内容
为遵守国家网络实名制规定,未绑定将限制内容发布与互动
所有评论(0)