Loading...
Articles
1748
Tags
1820
Categories
32
Home
Archives
Tags
Categories
About
守株阁
故障演练平台设计
Back to Home
Search
Home
Archives
Tags
Categories
About
故障演练平台设计
Created
2021-05-27
|
Updated
2026-10-08
|
基础设施
|
Word Count:
80
|
Reading Time:
1mins
|
Post Views:
目的
验证故障应急处理能力
验证服务降级及止损能力
验证中间件、存储和服务的稳定性
发现隐患,提升服务可用率
要具备的功能
有环境恢复的能力。
准备演练场景。
感知监控。
权限管理、时间管理。
Author:
magicliang
Link:
https://magicliang.github.io/2021/05/27/%E6%95%85%E9%9A%9C%E6%BC%94%E7%BB%83%E5%B9%B3%E5%8F%B0%E8%AE%BE%E8%AE%A1/
Copyright Notice:
All articles on this blog are licensed under
CC BY-NC-SA 4.0
unless otherwise stated.
云计算
Related Articles
2021-06-21
Lambda VS ECS
Lambda 的好处 按使用付费(云计算都有这个特点)。 把资源( CPU 或内存分配)的 quota 封装得很好。 无需关心监控和运维。 自动扩展(无需关心物理 nodes。node 既意味着系统可拆解,也意味着系统可联结)。 Lambda 的坏处 多步执行环节很慢 特定 function 的执行隔离不好,可能多个用户相互踩踏 ECS ECS 云基础设施在架构上更易扩展,只要稍加改造就能和系统集成。 参考:《我们为什么从 Lambda 迁移到了 ECS?》
2026-09-27
分布式系统(E04):Lambda 与 SkyPilot 的执行和调度边界
AWS Lambda和SkyPilot都能“把任务放到云上跑”,但它们调度的单位不同。Lambda围绕一次函数调用管理执行环境、扩缩容和事件重试;SkyPilot围绕带资源需求的批任务或服务,在多个云和区域间选择资源并管理集群生命周期。前者隐藏机器,后者显式优化机器放置。两者都不是共识协议,也都不会自动使外部副作用恰好一次。 分布式系统(E03):IPFS、SUNDR 与 Bitcoin 的开放网络信任模型 四个问题决定执行形态 选择云执行方式前,需要把工作拆成四项:任务粒度、启动成本、失败后的重放边界、目标函数。短小无状态事件适合按调用扩展;需要GPU、长时训练、特定区域或跨云价格比较的作业更像资源放置问题。 flowchart TD J[工作负载] --> G{调度单位} G -->|单次事件/函数| L[Lambda式执行] G -->|任务+资源集合| S[SkyPilot式放置] L --> R[初始化、调用、重试] S --> P[选云、建集群、运行、恢复] R --> E[外部效果仍需幂...
Contents
1.
目的
2.
要具备的功能
簡
Search
Loading Database