Amazon의 글로벌 클라우드 서비스 중단: 타임라인, 원인 및 범위

  • 오전 9시경(미국 동부 표준시)에 시작된 US-EAST-1의 진원지에서 발생한 글로벌 AWS 사고
  • Amazon은 DynamoDB에서 문제의 원인과 기본 DNS 문제를 감지했으며, 정오까지 점진적으로 복구했습니다.
  • Alexa, Prime Video, Canva, Duolingo, Snapchat, Fortnite 및 Roblox와 같은 비디오 게임 등 여러 서비스에 미치는 영향
  • 완화 조치가 시행되는 동안 구체적인 영향은 오후까지 지속되었습니다.

글로벌 AWS 서비스 중단의 일반 이미지

아마존 웹 서비스(AWS) 인프라에 영향을 미치는 광범위한 장애로 인해 여러 국가의 수천 개의 플랫폼과 애플리케이션 서비스가 간헐적으로 중단되었습니다. 연결 문제, 지연 문제, 로드 실패 에 대한 사용자 보고가 오늘 아침 일찍 급증했으며 , 특히 미국에서 집중적으로 발생했고 유럽에서도 그 영향이 뚜렷하게 나타났습니다.

회사 상태 대시보드에 따르면, 해당 문제는 US-EAST-1 리전(버지니아주 북부) 에서 발생했으며 여러 API에서 오류 발생률이 비정상적으로 급증했습니다. 오전 중반쯤 AWS는 여러 서비스에서 복구 조짐이 뚜렷하게 나타나고 있다고 밝혔지만, 관련 팀들은 여전히 ​​문제를 완전히 해결하고 모든 서비스를 정상화하기 위해 노력하고 있습니다.

사건의 연대기

첫 번째 경고는 스페인 본토 시간 으로 오전 9시경에 나타났 으며, 직후 장애 발생 건수가 급증하고 DownDetector와 같은 모니터링 도구에 지속적으로 알림이 전송되었습니다. 오전 11시부터 회사 측은 가능한 원인을 파악 하고 다양한 계층에 걸쳐 복구를 가속화하는 완화 조치를 시행하기 시작했다고 발표했습니다.

정오 무렵 AWS는 대부분의 운영이 정상으로 돌아오고 있다고 발표했지만 , 영향을 받은 지역에서는 특정 요청 및 서비스에 대한 간헐적인 제한이 있을 수 있다고 언급했습니다. 오후 초반까지 안정화 작업이 계속되면서 잔여 영향이 여전히 느껴졌습니다.

Amazon 클라우드 문제에 대한 그림

기술적 기원은 어디에 있었나요?

해당 회사는 관리형 키-값 데이터베이스 서비스인 아마존 다이나모DB 에 집중했는데, US-EAST-1에 있는 다이나모DB 엔드포인트에서 장애가 발생하여 여러 종속 서비스에 연쇄적인 오류가 발생했습니다. AWS는 근본적인 DNS 문제를 원인으로 지목했으며 , 이 문제는 단계적으로 해결되고 있습니다.

실제로 도메인 이름 시스템(DNS)이 올바르게 확인되지 않으면 애플리케이션이 리소스를 찾을 수 없어 연결 오류, 시간 초과 및 데이터 로딩 실패가 발생합니다. AWS는 지속적인 문제가 발생하는 고객에게 DNS 캐시를 플러시하여 올바른 엔드포인트로의 확인을 복원하도록 권장했습니다.

누가 영향을 받았나요?

그 영향은 광범위했습니다. 아마존 자체도 알렉사프라임 비디오 에서 문제를 보고했으며, 캔바 , 듀오링고 , 스냅챗 과 같은 타사 서비스에서도 문제가 발생했습니다. AWS 클라우드를 사용하는 AI 생성 플랫폼과 협업 애플리케이션 에서도 서비스 중단이 관찰되었습니다 .

디지털 엔터테인먼트 분야도 예외는 아니었습니다. 포트나이트 , 로블록스 , 클래시 로얄 처럼 사용자 기반이 큰 게임 및 서비스에서 로그인 또는 연결 오류가 발생했으며 , 일부 게임 스토어와 런처는 트래픽이 안정될 때까지 영향을 줄이기 위한 조치를 시행했습니다.

스페인에 미치는 영향

전국적으로 많은 사용자들이 특히 오전 시간대에 디지털 서비스 애플리케이션과 웹사이트 접속에 문제를 겪었다고 보고했습니다. 티켓마스터와 같은 티켓 판매 플랫폼도 영향을 받아 정오에 예정되었던 티켓 판매가 지연되었으며, 특히 큰 기대를 모았던 콘서트 티켓 판매가 차질을 빚었습니다.

금융기관과 주요 소비자 플랫폼들은 온라인 시스템에서 개별적인 장애를 보고했지만 , 그 영향은 지역 및 서비스에 따라 달랐습니다. 장애가 발생한 미국 지역에서 완화 조치가 시행됨에 따라 유럽에서는 접속이 점차 복구되었습니다.

현재 상황 및 권장 사항

시간이 흐르면서 AWS는 대부분의 서비스에서 상당한 복구 조짐을 보이고 있다고 밝혔지만 , US-EAST-1 지역의 특정 운영에는 여전히 제한이 남아 있다고 덧붙였습니다. AWS는 문제를 완전히 해결하기 위해 지속적으로 성능을 모니터링하고 필요한 조정을 진행하고 있습니다.

여전히 간헐적인 오류가 발생하는 경우 AWS 공식 상태 보고서를 확인하고, 필요한 경우 DNS 캐시를 지우 거나 해당 리전의 엔드포인트 이름 확인에 의존하는 클라이언트 및 서비스를 재시작하는 것이 좋습니다. 중요 배포 환경에서는 지연 시간 및 일시적인 오류의 영향을 최소화하기 위해 장애 조치 , 네트워크 종속성 및 재시도 정책을 확인하는 것도 권장됩니다 .

이번 에피소드는 클라우드 컴퓨팅 인프라가 디지털 경제의 구조적 기반으로 자리 잡은 정도를 보여줍니다. 핵심 허브의 국지적 장애는 스트리밍, 비디오 게임, 금융 및 생산성 애플리케이션에 이르기까지 전 세계적인 연쇄 반응 으로 이어질 수 있습니다.


Google에서 선호하는 검색 엔진으로 추가