|
| 1 | +"""Driver for Ray checkpoint load benchmark.""" |
| 2 | + |
| 3 | +import contextlib |
| 4 | +import dataclasses |
| 5 | +import os |
| 6 | +import time |
| 7 | +import uuid |
| 8 | + |
| 9 | +import ray |
| 10 | +import ray.train |
| 11 | +import torch |
| 12 | +import torch.distributed as dist |
| 13 | +import torch.distributed.checkpoint as dcp |
| 14 | +from torch.distributed.checkpoint.state_dict import ( |
| 15 | + StateDictOptions, |
| 16 | + get_state_dict, |
| 17 | + set_model_state_dict, |
| 18 | + set_optimizer_state_dict, |
| 19 | + set_state_dict, |
| 20 | +) |
| 21 | + |
| 22 | +from gcsfs.tests.perf.subsystembenchmarks.checkpointing.driver import ( |
| 23 | + CheckpointDriver, |
| 24 | + CheckpointResult, |
| 25 | +) |
| 26 | +from gcsfs.tests.perf.subsystembenchmarks.checkpointing.ray_data.common import ( |
| 27 | + ensure_ray_initialized, |
| 28 | + find_free_port, |
| 29 | + resolve_storage, |
| 30 | + save_checkpoint_step, |
| 31 | + setup_distributed_env, |
| 32 | + setup_model_and_optimizer, |
| 33 | +) |
| 34 | + |
| 35 | + |
| 36 | +@ray.remote |
| 37 | +class RayCheckpointSetupWorker: |
| 38 | + """Ray Actor that creates the initial checkpoint on storage for load benchmarks.""" |
| 39 | + |
| 40 | + def __init__(self, rank, world_size, port, prefix, params): |
| 41 | + self.rank = rank |
| 42 | + self.world_size = world_size |
| 43 | + self.port = port |
| 44 | + self.prefix = prefix |
| 45 | + self.params = params |
| 46 | + |
| 47 | + def setup_and_save(self): |
| 48 | + try: |
| 49 | + setup_distributed_env(self.rank, self.world_size, self.port) |
| 50 | + model, optimizer = setup_model_and_optimizer(self.params) |
| 51 | + fs, arrow_fs, base_path = resolve_storage(self.prefix) |
| 52 | + destination_ckpt = f"{base_path.rstrip('/')}/model.ckpt" |
| 53 | + save_checkpoint_step( |
| 54 | + model, |
| 55 | + optimizer, |
| 56 | + self.params, |
| 57 | + self.rank, |
| 58 | + arrow_fs, |
| 59 | + fs, |
| 60 | + destination_ckpt, |
| 61 | + staging_prefix="ray-setup-ckpt", |
| 62 | + ) |
| 63 | + finally: |
| 64 | + dist.destroy_process_group() |
| 65 | + |
| 66 | + |
| 67 | +@ray.remote |
| 68 | +class RayCheckpointLoadWorker: |
| 69 | + """Ray Actor executing distributed checkpoint load operations on CPU.""" |
| 70 | + |
| 71 | + def __init__(self, rank, world_size, port, prefix, params): |
| 72 | + self.rank = rank |
| 73 | + self.world_size = world_size |
| 74 | + self.port = port |
| 75 | + self.prefix = prefix |
| 76 | + self.params = params |
| 77 | + |
| 78 | + def setup(self): |
| 79 | + setup_distributed_env(self.rank, self.world_size, self.port) |
| 80 | + self.model, self.optimizer = setup_model_and_optimizer(self.params) |
| 81 | + self.fs, self.arrow_fs, self.base_path = resolve_storage(self.prefix) |
| 82 | + self.destination_ckpt = f"{self.base_path.rstrip('/')}/model.ckpt" |
| 83 | + |
| 84 | + def load_rounds(self): |
| 85 | + try: |
| 86 | + durations = [] |
| 87 | + is_sharded = self.params.strategy in ( |
| 88 | + "fsdp_sharded", |
| 89 | + "model_parallel_sharded", |
| 90 | + ) |
| 91 | + for round_idx in range(self.params.rounds): |
| 92 | + dist.barrier() |
| 93 | + t_start = time.perf_counter() |
| 94 | + |
| 95 | + checkpoint = ray.train.Checkpoint( |
| 96 | + path=self.destination_ckpt, filesystem=self.arrow_fs |
| 97 | + ) |
| 98 | + # Ensure all workers on the host share the same UUID for this round |
| 99 | + # so Ray's built-in file locking deduplicates the download across workers |
| 100 | + # and cleans up the shared temporary directory after all workers exit. |
| 101 | + checkpoint._uuid = uuid.uuid5( |
| 102 | + uuid.NAMESPACE_URL, f"{self.destination_ckpt}-round-{round_idx}" |
| 103 | + ) |
| 104 | + |
| 105 | + directory_context = ( |
| 106 | + checkpoint.as_directory() |
| 107 | + if is_sharded or self.rank == 0 |
| 108 | + else contextlib.nullcontext(None) |
| 109 | + ) |
| 110 | + with directory_context as local_dir: |
| 111 | + if is_sharded: |
| 112 | + options = StateDictOptions( |
| 113 | + full_state_dict=False, |
| 114 | + cpu_offload=False, |
| 115 | + ) |
| 116 | + model_state, opt_state = get_state_dict( |
| 117 | + self.model, self.optimizer, options=options |
| 118 | + ) |
| 119 | + app_state = {"model": model_state, "optimizer": opt_state} |
| 120 | + dcp.load( |
| 121 | + {"app": app_state}, |
| 122 | + storage_reader=dcp.FileSystemReader(local_dir), |
| 123 | + ) |
| 124 | + set_state_dict( |
| 125 | + self.model, |
| 126 | + self.optimizer, |
| 127 | + model_state_dict=app_state["model"], |
| 128 | + optim_state_dict=app_state["optimizer"], |
| 129 | + options=options, |
| 130 | + ) |
| 131 | + del app_state, model_state, opt_state |
| 132 | + else: |
| 133 | + options = StateDictOptions( |
| 134 | + full_state_dict=True, |
| 135 | + cpu_offload=False, |
| 136 | + broadcast_from_rank0=True, |
| 137 | + ) |
| 138 | + if self.rank == 0: |
| 139 | + ckpt_file = os.path.join(local_dir, "checkpoint.pt") |
| 140 | + state = torch.load( |
| 141 | + ckpt_file, map_location="cpu", weights_only=False |
| 142 | + ) |
| 143 | + model_state = state["model"] |
| 144 | + opt_state = state["optimizer"] |
| 145 | + else: |
| 146 | + model_state = {} |
| 147 | + opt_state = {} |
| 148 | + |
| 149 | + set_model_state_dict( |
| 150 | + self.model, |
| 151 | + model_state, |
| 152 | + options=options, |
| 153 | + ) |
| 154 | + set_optimizer_state_dict( |
| 155 | + self.model, |
| 156 | + self.optimizer, |
| 157 | + opt_state, |
| 158 | + options=options, |
| 159 | + ) |
| 160 | + if self.rank == 0: |
| 161 | + del state, model_state, opt_state |
| 162 | + |
| 163 | + dist.barrier() |
| 164 | + t_end = time.perf_counter() |
| 165 | + durations.append((t_start, t_end)) |
| 166 | + |
| 167 | + return durations |
| 168 | + finally: |
| 169 | + dist.destroy_process_group() |
| 170 | + |
| 171 | + |
| 172 | +def run_ray_load(prefix, params): |
| 173 | + """Runs single or distributed checkpoint load benchmark across Ray actor workers.""" |
| 174 | + ensure_ray_initialized() |
| 175 | + world_size = params.world_size |
| 176 | + port = find_free_port() |
| 177 | + |
| 178 | + workers = [ |
| 179 | + RayCheckpointLoadWorker.remote(rank, world_size, port, prefix, params) |
| 180 | + for rank in range(world_size) |
| 181 | + ] |
| 182 | + ray.get([w.setup.remote() for w in workers]) |
| 183 | + results = ray.get([w.load_rounds.remote() for w in workers]) |
| 184 | + |
| 185 | + durations = [] |
| 186 | + for r in range(params.rounds): |
| 187 | + begins = [results[rank][r][0] for rank in range(world_size)] |
| 188 | + ends = [results[rank][r][1] for rank in range(world_size)] |
| 189 | + durations.append(max(ends) - min(begins)) |
| 190 | + return durations |
| 191 | + |
| 192 | + |
| 193 | +class RayCheckpointReadDriver(CheckpointDriver): |
| 194 | + """Driver for Ray checkpoint load benchmarks.""" |
| 195 | + |
| 196 | + def setup(self, prefix: str, params): |
| 197 | + """Generates the source checkpoint on storage using setup topology.""" |
| 198 | + ensure_ray_initialized() |
| 199 | + setup_world_size = ( |
| 200 | + getattr(params, "setup_world_size", None) or params.world_size |
| 201 | + ) |
| 202 | + setup_tp = ( |
| 203 | + getattr(params, "setup_tensor_parallel_size", None) |
| 204 | + or params.tensor_parallel_size |
| 205 | + ) |
| 206 | + setup_dp = ( |
| 207 | + getattr(params, "setup_data_parallel_size", None) |
| 208 | + or params.data_parallel_size |
| 209 | + ) |
| 210 | + |
| 211 | + setup_params = dataclasses.replace( |
| 212 | + params, |
| 213 | + world_size=setup_world_size, |
| 214 | + tensor_parallel_size=setup_tp, |
| 215 | + data_parallel_size=setup_dp, |
| 216 | + ) |
| 217 | + port = find_free_port() |
| 218 | + try: |
| 219 | + workers = [ |
| 220 | + RayCheckpointSetupWorker.remote( |
| 221 | + rank, setup_world_size, port, prefix, setup_params |
| 222 | + ) |
| 223 | + for rank in range(setup_world_size) |
| 224 | + ] |
| 225 | + ray.get([w.setup_and_save.remote() for w in workers]) |
| 226 | + finally: |
| 227 | + if ray.is_initialized(): |
| 228 | + ray.shutdown() |
| 229 | + |
| 230 | + def run(self, prefix: str, params) -> CheckpointResult: |
| 231 | + """Executes the checkpoint load benchmark across Ray actor workers.""" |
| 232 | + try: |
| 233 | + durations = run_ray_load(prefix, params) |
| 234 | + return CheckpointResult(durations=durations) |
| 235 | + finally: |
| 236 | + if ray.is_initialized(): |
| 237 | + ray.shutdown() |
0 commit comments