提供商建设
云服务提供商建设并运营数据中心、物理设备和云平台
申请、验证和回收计算资源
云服务器由谁提供、怎样申请登录,用完怎样确认资源和费用已处理
用户按需获得计算等资源,不必自建底层物理基础设施
云服务提供商建设并运营数据中心、物理设备和云平台
外部用户通过控制台、命令行或 API 申请所需资源
用户可以创建、调整、停止或释放实例,平台记录运行时长和资源用量
用户通过提供商的控制台、命令行或 API 申请和释放资源;平台记录用量
公有云/私有云和 IaaS/PaaS/SaaS 需要回答不同问题
| 问题 | 公有云/私有云 | IaaS/PaaS/SaaS |
|---|---|---|
| 初步判断 | 谁建设并运营资源,哪些用户可以申请 | 用户拿到计算、存储和网络资源后,还要自行管理哪些部分 |
| 典型判断 | 外部用户是否可以按需使用提供商资源池 | 用户是否需要管理虚拟机、操作系统和应用 |
| 特别判断 | 所有服务层都由用户管理吗? | 资源是否面向公众开放? |
公有云/私有云和 IaaS/PaaS/SaaS,是两种不同维度的分类
但宿主机位置、管理入口和计量方式不同
运行在自己控制的宿主机上
用户同时管理物理设备、虚拟化软件和虚拟机内的操作系统
观察 CPU、内存和网络怎样被虚拟化,进行系统测试,建立本地环境
运行在提供商的数据中心和资源池中
用户申请资源,并管理实例内的操作系统与应用
在线服务、临时任务和需要快速获得资源的场景
提供商管理物理设备和云平台;用户申请虚拟机并自行管理
| 场景 | 请先判断 | 需要找到的证据 |
|---|---|---|
| 在笔记本上运行 VMware 虚拟机 | 公有云/非公有云/证据不足 | 它是否由外部服务商的共享资源池按需供给? |
| 远程登录实验室服务器 | 公有云/非公有云/证据不足 | 是否有资源池、按需、计量和回收证据? |
| 在云平台申请一台按量计费实例 | 公有云/非公有云/证据不足 | 是否有面向外部用户的标准服务、资源池、按需、计量和回收证据? |
| 租用机房中的长期独占物理服务器 | 公有云/非公有云/证据不足 | 哪些特征已证实,哪些仍待核对? |
提供商管数据中心和平台,租户管实例、操作系统、应用、数据
建设和运行数据中心、物理设备、底层网络与云平台
维护资源池,让租户获得可用资源
让租户能够申请、计量和回收云资源
选择实例与网络,管理身份凭证、实例内操作系统、应用和数据
控制资源何时运行与释放
配置、数据与费用符合任务需要
租户不必自建底层设施,但仍要对配置、安全、数据和费用负责
费用、安全、可用性依然需要租户选择、配置、维护
| 常见说法 | 平台能做到什么 | 租户还要做什么 |
|---|---|---|
| 成本较低 | 支持按量使用 | 选择规格、时长;清理残留资源 |
| 快速弹性 | 可以扩展、缩减或组合 | 设置监控指标、触发规则 |
| 安全可靠 | 提供基础设施保护、隔离和安全工具 | 收紧访问、维护系统并设计数据恢复 |
| 使用便捷 | 快速申请资源 | 理解每项配置的影响与费用 |
选择规格、设置监控和维护系统,是满足任务需要的前提
| 问题 | 判断责任 | 定位对象 |
|---|---|---|
| 供电、物理硬盘故障 | 提供商/租户/待核对 | 机房供电或物理磁盘,谁维护? |
| 安全组开放管理端口 | 提供商/租户/待核对 | 谁配置规则,谁能改变? |
| 操作系统未安装补丁 | 提供商/租户/待核对 | 云平台还是实例内操作系统? |
| 应用数据无备份 | 提供商/租户/待核对 | 数据保护与恢复由谁负责? |
先定位故障对象,再查服务说明和合同中的责任边界
区域划定地理服务范围,可用区划分其中的故障边界
位置:区域 → 可用区
网络:VPC 可跨多个可用区;子网通常位于一个可用区;实例部署在子网中
数据中心所在地,影响时延、数据位置、产品可用性和跨区通信
先看主要用户、设备与数据要求
是在某个区域内相对独立的供电、网络和基础设施单元
主要关注资源依赖与故障隔离
| 任务要求 | 位置判断 | 核查证据 |
|---|---|---|
| 主要用户集中在华东 | 区域/可用区/两者 | 时延与网络路径 |
| 数据须在指定地理范围 | 区域/可用区/两者 | 数据位置与合规 |
| 抵御机房级故障 | 区域/可用区/两者 | 隔离边界与应用冗余 |
| GPU 规格仅部分位置可用 | 区域/可用区/两者 | 产品与库存 |
按用户、数据位置、故障边界和规格供应,选择区域与可用区
多个可用区只提供故障隔离条件,还要让计算、数据和访问路径能够切换
多个可用区都要有能够接替工作的实例
业务数据需要复制、同步或可靠恢复
用户请求需要被重新分配到仍可用的资源
即使所在区域有多个可用区,只有一台实例仍是单点
可用区只是条件,高可用还需要计算、数据和访问路径都能切换
VPC 通常覆盖一个区域;子网通常位于一个可用区,实例部署在子网中
资源位于哪个地理范围,以及可能发生哪些基础设施故障
VPC 把资源组织在一个逻辑隔离网络中,并可跨多个可用区
子网从 VPC 划分地址范围,通常位于一个可用区
实例通过网卡连接子网,并使用私有 IP 地址通信
区域、可用区、VPC 和子网不能互相替代
VPC 和子网组织网络范围与实例位置,安全组控制到达实例的流量
把租户的云资源组织在一个逻辑隔离的私有网络中
规定私有网络可用地址范围,便于规划并避免网段冲突
从 VPC 划分网络段,实例部署在其中
实例在云内通信使用的私有地址,不能直接作为互联网入口
按方向、来源地址和端口控制流量;放行不等于服务启动
VPC 组织私有网络,子网分配地址范围,安全组决定哪些流量可以通过
公网入口、网络规则和系统服务共同决定能否到达服务,凭证决定能否登录
电脑 → 公网入口 → 路由或网关 → 安全组 → 实例网卡 → 系统服务
提供互联网入口,并接入通往实例的网络路径
按方向、来源和端口决定哪些流量可以通过
SSH 服务、Web 服务等运行并监听相应端口

公网入口提供可寻址路径,规则决定放行,服务与凭证决定能否登录
当前连接的是否为目标实例的公网入口?
安全组是否放行当前来源的 SSH 端口?
SSH 服务是否运行并监听端口?
用户名和密钥/密码是否与目标实例匹配?
“运行中”只证明云平台已启动计算资源
实例规格、镜像、云硬盘和云网络分别承担不同作用
决定虚拟 CPU、内存和计算性能
提供实例操作系统或预装环境
保存系统与业务数据
提供私有地址,并可配置
删除实例时也要分别检查磁盘和公网入口
先运行什么、保存什么、谁来访问、运行多久、能否中断、用完怎样删除
软件、并发与性能 → CPU、内存和镜像
数据量、读写与恢复 → 磁盘和备份
谁访问、从哪里访问、使用什么协议 → 私有连接、公网入口和访问规则
时长与可预测性 → 计费方式
可重算任务通常能接受偶尔中断;在线服务通常需要连续运行
在创建前列出关联资源和释放条件
| 任务 | 需要选择什么 | 可能怎样失败,用完怎样处理 |
|---|---|---|
| 两小时的 Linux 测试 | 规格、镜像、网络和是否需要公网入口 | 运行时长、暴露面、课后释放 |
| 持续一学期的网站 | 计算、数据保护和访问方式 | 持续成本、可用性和恢复方案 |
| 允许失败后重算的任务 | 计算资源、数据保存和访问方式 | 可接受的中断、重算条件和结果保存 |
要考虑数据放哪里、谁能访问、运行多久,以及失败后如何恢复
资源申请、访问、计量和回收
核对账号、权限与费用限制
选择平台、区域、最小规格和当前计费规则
使用所需密钥或强密码
保留已验证实例的截图
记录实例、磁盘、公网入口和其他关联资源
确定位置、实例、网络、访问和费用
根据用户与数据所在地、要隔离的故障选择区域与可用区
把实例放入 VPC 的子网,并选择合适的安全组
确定规格、镜像、磁盘和登录凭证
按需要配置公网入口和最小访问规则
确认计费方式、关联资源与释放行为
公网入口、规则、服务和凭证齐全,SSH 才能成功
01
02
03
04ssh <user>@<public-ip>
hostname
hostname -I
uname -a记录状态、私有 IP 和公网入口
SSH 登录并确认目标实例
查看主机名、地址和系统信息
区分运行、登录和应用可用性
SSH 成功只证明系统登录,不等于应用可用
监控指标要结合任务需求,才能判断是否调整资源
查看平台提供的 CPU、内存、磁盘、网络和实例状态
结合任务负载判断高使用率、低使用率或短时波动
根据证据变更规格、磁盘或相关服务,并核查停机和费用影响
重装、切换系统或删除前确认系统盘、数据盘和恢复路径
先用指标判断是否需要调整,再核对停机、费用和数据恢复
| 当前状态 | 是否完成回收 | 还要核对 |
|---|---|---|
| 只关 SSH 终端 | 是/否/待核对 | 实例、磁盘、公网 IP 等关联资源 |
| 操作系统已关机 | 是/否/待核对 | 云平台实例、磁盘、公网 IP |
| 实例已删除 | 是/否/待核对 | 云硬盘、公网 IP、快照等 |
| 清单归零并核对费用 | 是/否/待核对 | 操作与费用记录 |
用后回收必须核对完整资源清单
从申请、访问、计量和回收中找到对应证据
| 云计算特征 | 本次操作中的证据 |
|---|---|
| 按需自助服务 | 用户通过标准入口自行申请与释放资源 |
| 广泛网络访问 | 用户通过网络访问控制台、实例和应用 |
| 资源池化 | 提供商从共享基础设施中分配逻辑资源 |
| 快速弹性 | 规格与资源数量可以根据需求调整 |
| 可计量服务 | 平台记录资源用量并形成费用 |
要用证据说明资源如何被供给、访问、计量和回收
实例规格、镜像、磁盘和网络可以随需求改变
用户不必淘汰整套物理设备才能获得新的逻辑资源
资源能够被重新创建,但软件与数据必须有可恢复的来源
更高规格意味着新的费用,软件与数据仍需迁移和维护
平台、区域、产品和配额也会变化
系统更新、应用安全、数据保护和成本管理不会自动完成
公有云提供可调整的资源服务,但用户依然需要管理资源并承担费用
以“两小时 Linux 测试”为例,提交一份资源使用记录