登录社区云,与社区用户共同成长
邀请您加入社区
当单卡无法容纳模型,或者大模型训练耗时过长时,开发者通常会考虑多 GPU。但“多插几张卡”并不等于训练速度自动翻倍。多卡之间需要同步梯度、交换数据,如果代码结构、通信或数据加载没有处理好,GPU数量增加后反而可能出现利用率下降。多 GPU 常见方式包括数据并行、张量并行和流水线并行。对于普通 PyTorch 深度学习项目,从单卡迁移到 DistributedDataParallel(DDP)通常是
分片策略是分布式数据库的核心决策,阿里云瑶池数据库旗下的 PolarDB-X 提供了业界最完整的解决方案:Hash/Range/List 三种传统策略 + 智能分片顾问的 AI 自动推荐。92% 的推荐准确率、45% 的性能提升、在线变更零停机——这 3 大优势让 PolarDB-X 成为分布式分片策略的首选和最佳方案。已有 10000+ 企业验证了 PolarDB-X 的分片能力,无论是高并发
随着大语言模型的爆发,如何高效地训练、部署和评估这些模型成为开发者面临的核心挑战。FastChat由加州大学伯克利分校等机构的研究者开发,是一个开源的 LLM 训练、服务和评估平台,旨在让研究人员和开发者能够以最小的成本,快速将前沿模型投入实际应用。FastChat 最引人瞩目的成就是支撑了著名的Chatbot Arena(大模型竞技场),该平台已为超过70 个 LLM处理了1000 万次以上的聊
随着AI算力、边缘计算、分布式业务的高速发展,传统自建机房、中心化公有云、固定算力租赁模式,普遍存在资源固化、扩容滞后、硬件适配性差、资源利用率低等痛点。分布式硬件远程智能调度与租赁模式成为当下算力轻量化落地的主流技术方案。本文以光途智枢技术架构为核心,系统性拆解资源层、调度层、交付层三层核心架构的技术原理、核心能力与落地优势,对比传统算力模式的技术差异,梳理适配业务场景,为开发者、企业技术选型提
然而,由于该线程实际上已不存在,其对应的在线日志(Redo Log)或归档日志也早已被清理,导致DRS的日志抓取组件(Logmanager)在初始化阶段即因无法定位有效的日志起点而陷入未知错误,最终导致任务失败。结合客户的实际数据库环境进行分析。然而,在任务配置完成后,启动“全量+增量”模式的迁移任务时,任务状态未能进入正常的同步阶段,而是迅速报错并进入失败(Failed)状态。为了定位根本原因,
本文档详细阐述了某MMO项目中麻将子游戏系统的分布式架构设计。系统作为畅玩阁(SmallGame)的组成部分,采用五服务器角色(GameServer、PlayServer、GameCenter、MatchCenter、SceneServer)协同工作,实现跨服麻将玩法。架构通过模块化设计分离游戏逻辑与基础设施,客户端和服务端共享部分核心组件但运行不同脚本。文档特别分析了玩家切图导致的"半开闭状态"
在多智能体系统广泛应用于自动驾驶、无人机编队等众多领域的背景下,实现多智能体之间高效、安全的点对点过渡至关重要。分布式模型预测控制(DMPC)作为一种强大的控制策略,能够使各智能体在考虑自身动态和与其他智能体相互作用的基础上,协同生成过渡轨迹。本文聚焦于基于 DMPC 的多智能体点对点过渡轨迹生成研究,旨在提升多智能体系统的协同性能与运行效率。多智能体系统由多个具有自主决策能力的智能体组成,这些智
Ray 是一个统一的开源分布式计算框架,专注于扩展 AI 和 Python 应用。它整合了核心运行时和机器学习工具库(如数据处理、训练、调优等),通过 Tasks、Actors 和 Objects 三大抽象简化分布式开发。Ray 支持单机到集群的无缝扩展,无需修改代码,适用于 ML 训练、强化学习、在线推理和数据处理等场景。安装简单(pip install ray),并提供可视化监控和调试工具,适
随着新能源大规模并网,传统微电网架构面临间歇性发电、消纳不足等挑战。微电网与源网荷储深度融合通过智能调度、柔性并网等技术,构建自主可控的智慧能源系统。该系统具备并网/孤网无缝切换、储能双向调控等功能,可提升供电可靠性至99.99%,新能源消纳率超90%,降低用电成本20%-40%。目前已在工业园区、数据中心等场景成功应用,未来将向AI智能调度、多微网集群方向发展,成为新型电力系统的重要支撑单元。
AI代理(Agent)是人工智能领域的一个核心概念,指的是能够感知环境、做出决策并采取行动以实现特定目标的自主实体。自主性(Autonomy):代理能够在没有人类直接干预的情况下运行,控制自己的行为和内部状态。反应性(Reactivity):代理能够感知环境的变化,并及时做出响应。主动性(Pro-activity):代理不仅仅对环境做出反应,还能够主动采取行动以实现目标。社交能力(Social A
在双碳目标下,多能互补技术通过整合电、热、冷、气、氢等多元能源形态,重构源网荷储系统架构。该技术从源侧多元发电协同、网侧多能流传输、荷侧柔性负荷改造、储侧多元储能协同四个环节实现突破,形成横向多能互补、纵向源网荷储协同的立体格局。数字孪生、AI优化算法等系统级技术支撑各环节深度融合,已在能源基地、城市园区等场景成功应用,显著提升新能源消纳率和能源利用效率。未来将向智能化、标准化、市场化方向升级,为
本文深入探讨了企业级营销矩阵系统的核心技术架构,重点分析了四大核心模块:1)分布式素材管理系统采用云原生架构实现素材全链路管理,包含多端断点续传、智能元数据提取和语义检索功能;2)多租户分级权限控制架构基于RBAC模型,支持复杂组织架构下的精细化权限管理;3)全链路数据统计系统整合多源数据,构建完整的营销指标体系;4)爆店码系统通过活码技术和一键发布实现裂变获客。文章详细阐述了各模块的技术实现细节
本文深入探讨了AI原生营销矩阵系统的分布式架构设计,针对传统工具堆砌式方案的缺陷,提出四层云原生架构解决方案。文章详细解析了统一平台适配层、智能调度引擎、AI内容生产流水线等核心模块的技术实现,包括适配器模式、XXL-JOB二次开发、多模态生成等技术要点。同时分享了高并发场景下的数据库优化、缓存策略和异步化改造等性能提升方案,以及数据加密、内容审核等安全合规设计。该方案已在多个行业落地应用,显著提
在双碳战略背景下,零碳园区建设加速推进,预计2030年市场规模将超5000亿元。AI算法通过监测-核算-调控-运维-优化全流程赋能,成为零碳转型的核心引擎。文章系统分析了AI在碳排管控、能源调度、设备运维等环节的应用:碳核算精度提升至95%,能源效率提高20%,运维成本降低30-40%。典型案例显示,保定高新区通过AI实现毫秒级能源调度,固德威工厂能源效率提升20%。
Petals是一个开源分布式项目,让普通用户能在个人设备上运行大语言模型。它采用类似BitTorrent的架构,支持Llama、Mixtral等大模型,推理速度比传统方案快10倍。用户只需几行代码即可调用405B参数的模型,无需本地存储完整权重。项目兼容Transformers库,支持模型微调和隐藏层访问。通过社区贡献GPU算力运行,提供公有/私有网络选项,适合开发者测试、科研和轻量化应用部署。目
本文总结了LLM长文本生成的工程化实践方案。针对一次性生成长文存在的截断、一致性衰减和事实性幻觉等问题,提出分段生成+上下文窗口管理的解决方案。核心思路包括:显式定义章节结构、滚动摘要保持连贯性、外部资料注入对抗幻觉。文章还强调了后处理的重要性,包括一致性检查、风格统一和AI痕迹改写。最后指出,高频合规场景建议使用现成工具,而小团队需求适合自行开发以深入理解LLM能力边界。文末分享了prompt设
从一行简单的爬虫代码,到如今构建起包含原生指纹隔离、跨平台并发调度、AI 行为伪装的企业级店群基建体系,电商自动化领域的门槛早已被大幅度拉高。“连点器”的时代早就过去了。现在的全域店群自动化,是一场融合了浏览器内核底层逆向、网络协议伪装、以及高并发系统架构的综合博弈。如果你想在这个极度内卷的赛道里活下来、甚至赚到 SaaS 的订阅费,掌握底层的环境隔离基建,是你唯一的出路。各位技术同仁,你们在开发
MindSpore Transformers Mcore架构是昇思大模型套件的核心创新,通过五大设计实现高效开发:1)模块化组件抽象,标准化Transformer层;2)训推一体化架构,统一训练推理接口;3)声明式配置开发,模型定义代码减少85%;4)自动多维并行,支持数据/张量/流水线/专家并行;5)兼容Hugging Face生态,实现开源模型天级迁移。该架构支持Llama、Qwen等主流模型
本文系统介绍了 Flink 计算资源管理机制,重点解析了 Task Slot 的内存隔离特性、Slot 共享优化和 Operator Chain 机制。详细阐述了并行度的四层设置方式及其优先级,推荐生产环境采用算子级并行度配置。通过源码分析揭示了资源申请与分配的核心流程,包括 Scheduler、SlotPool 和 JobMaster 的协作机制。最后给出生产环境配置建议:合理设置 Slot 内
AI Agent(人工智能代理)是一种能够感知环境、做出决策并执行行动的智能系统。它可以被视为一个"软件机器人",具有一定的自主性和目标导向性。感知能力:能够接收和理解用户输入、系统状态或环境数据推理能力:基于感知到的信息,运用知识和模型进行推理和决策行动能力:能够执行具体的任务,如回答问题、生成内容、调用API等学习能力:能够从经验中学习,不断优化自身的行为和性能交互能力:能够与用户、其他Age
基于 Kafka + ELK + Ollama + OpenClaw构建智能日志收集与 AIOps 告警平台,10 台 CentOS Stream 10 服务器实现完整闭环:Filebeat 采集 Nginx 日志,Kafka 集群缓冲,Python 清洗后分流至 MySQL 持久化与 ES 实时分析,Kibana 可视化;Ollama 本地大模型 AI 判断异常,触发 OpenClaw 自动诊断
本文探讨了AI Agent在实际工程落地中的关键问题与演进方向。文章指出当前对Agent存在严重误解,强调Agent不是单一程序而是分布式系统结构,其核心在于智能与执行的分离。通过分析云端Agent和本地Agent的优劣势,提出未来方向应是分层协作:云端负责思考决策,本地负责环境执行。文章深入剖析了CLI Agent作为"半个Agent Runtime"的真实角色,并指出Age
摘要:数字诺亚方舟利用区块链技术构建分布式系统,旨在保存人类核心知识、文化遗产和生物数据,以应对全球性风险。作为测试从业者,需确保系统在极端条件下的可靠性、安全性和可持续性。文章分析了区块链测试的挑战,包括去中心化环境健壮性、智能合约安全、长期可靠性及隐私保护,并探讨了分层测试架构、AI驱动测试等方法和工具。测试工程师需从工具使用者转向架构设计者,融合数学证明与动态测试,推动绿色区块链发展,为人类
阿里云人工智能平台 PAI 基于 NVIDIA 强大的 Isaac Lab 机器人多模态强化学习框架,结合 NVIDIA 多卡多节点 GPU 集群的算力优势,探索如何将感知强化学习训练的规模化潜力真正释放出来。
✅作者简介:热爱科研的Matlab仿真开发者,擅长毕业设计辅导、数学建模、数据处理、建模仿真、程序设计、完整代码获取、论文复现及科研仿真。🍎 往期回顾关注个人主页:Matlab科研工作室👇 关注我领取海量matlab电子书和数学建模资料🍊个人信条:格物致知,完整Matlab代码获取及仿真咨询内容私信。
我们的目的是深入了解在AI原生应用这个大舞台上,AI代理的分布式架构到底是怎么回事。范围涵盖了从基本概念到实际应用,再到未来发展等多个方面。就好比我们要去探索一个神秘的城堡,从城堡的大门开始,到城堡里的每一个房间,再到城堡未来可能的扩建方向,都在我们的探索范围内。接下来我们会按照一定的顺序来展开。先介绍核心概念,让大家对AI代理和分布式架构有个初步的认识;然后讲讲核心算法原理和数学模型,这就像是给
博主消失的一段时间一直在忙着准备面试和参加一些线下的技术分享会,有一阵子没更新文章了。在准备面试材料的时候,我把自己做过的 MessagePulse 项目(12,000 QPS 的高并发消息系统)从头梳理了一遍,发现最让我能聊出深度的话题,反而是监控体系——从最开始的 ELK 查日志,到 Prometheus + Grafana,再到后来接触的阿里云 ARMS。
所谓人机共忆,我指的是那种互动性遭遇,我们在其中以对话的准社会形式与基于LLM的聊天机器人构建记忆,这些聊天机器人被设计为与我们进行社会互动,如与HereAfter AI的生活故事,或与Replika的童年记忆。与Wegner的交易记忆系统一样,这里也有一个共享记忆基础的二人组——你和AI伙伴。共忆过程以分布式记忆或AI策划记忆形式中不存在的方式从人类伙伴那里唤起社会行为。每个参与者根据对话规范轮
本文深入解析Apache SkyWalking全链路追踪技术,针对微服务架构下分布式请求追踪难题提供解决方案。文章首先阐述全链路追踪的核心理论,包括Trace、Span等概念和OpenTracing规范;然后详细拆解SkyWalking的架构设计,包括Agent探针、OAPServer等模块;重点剖析JavaAgent无侵入采集、上下文传播等底层原理;通过SpringBoot实战案例演示服务接入过
数据库作为信息系统的核心基础设施,其选型不仅关乎性能表现,更与数据主权、供应链安全及长期演进能力紧密相关。金仓HTAP分布式集群立足真实业务痛点,在分布式一致性、混合负载调度、智能运维等关键技术环节持续打磨,已形成覆盖金融、医疗、能源、交通等十余个行业的规模化落地验证。未来,随着多模数据融合、AI原生查询优化、云边端协同等能力的逐步增强,该架构将进一步拓展在物联网时序分析、边缘智能推理、实时数字孪
随着LLM(大语言模型)在企业级应用的深入,AI不再仅仅是一个简单的对话框,而是演变成了复杂的AI Agent(智能体)系统。为了让AI能够实时获取企业私有数据、调用内部API,Anthropic推出了MCP(Model Context Protocol)协议。
本文会从基础概念→基础原语→核心进阶原语→大模型训练落地场景,逐层系统讲解,完全贴合新手学习的大模型分布式训练场景。
分布式多智能体系统在众多领域有着广泛应用。在军事领域,多架无人机组成的编队可执行侦察、攻击等任务,通过分布式控制实现协同行动,提高作战效率和生存能力;在智能交通中,自动驾驶车辆构成的系统可看作多智能体,通过编队控制优化交通流量,减少拥堵;在工业生产中,多个机器人协作完成复杂装配任务,分布式多智能体编队控制能确保各机器人高效配合。
摘要:2015-2025年是云原生模型训练从实验室走向产业落地的关键十年,完成了从小众技术到AI基础设施的革命性转变。这十年经历了四个发展阶段:启蒙垄断期(2015-2017)以Docker容器化和TensorFlow分布式训练为代表;工程突破期(2018-2020)MLOps标准化和国产化突破;爆发跃升期(2021-2023)大模型训练需求推动万卡集群和Serverless技术成熟;普惠成熟期(