OpenAI

ChatGPT 및 파운데이션 모델 개발 방법

당사가 모델을 개발하고 이를 ChatGPT와 같은 제품에 적용하는 방법에 대해 자세히 알아보기

마지막 수정: 4 days ago

ChatGPT를 구동하는 모델을 포함해 OpenAI의 파운데이션 모델은 세 가지 주요 정보 출처를 사용해 개발됩니다. (1) 인터넷에서 공개적으로 이용 가능한 정보, (2) 타사와의 파트너십을 통해 접근하는 정보, (3) 사용자, 인간 트레이너, 연구자가 제공하거나 생성하는 정보입니다.

ChatGPT에 사용되는 것과 같은 파운데이션 모델을 개발하는 과정에는 학습 데이터 준비, 사전 학습, 사후 학습을 비롯해 배포 후 지속적인 평가와 개선에 이르기까지 여러 단계가 포함됩니다. 각 단계에서는 모델의 성능, 신뢰성, 안전성 향상을 포함한 다양한 목적으로 여러 유형의 정보가 활용될 수 있습니다. 

이 문서에서는 모델 개발에 활용되는 정보의 범위, 개인정보 보호법을 준수하며 정보를 수집하고 사용하는 방식, 그리고 학습 과정 전반에 적용되는 보호 조치를 설명합니다. 서비스 사용자로부터 정보를 어떻게 수집하고 사용하는지, 그리고 ChatGPT 대화가 모델 학습에 활용되지 않도록 설정하는 방법을 포함한 자세한 내용은 개인정보 보호 정책이 지원 센터 문서를 참고하세요.

ChatGPT란 무엇이고 어떻게 작동하나요?

ChatGPT는 인터넷 또는 앱을 통해 이용할 수 있는 인공지능 기반 서비스입니다. 정보 정리 및 요약, 번역 지원, 코딩 보조, 리서치 및 분석, 여러 도구에 걸친 다단계 작업 수행, 이미지 분석 및 생성, 창의적인 아이디어 발상, 기타 일상적인 활동 등 다양한 용도로 활용할 수 있습니다. ChatGPT는 텍스트, 이미지, 오디오, 영상 등 다양한 데이터를 바탕으로 패턴을 학습하여 사용자 질문과 지시를 이해하고 이에 적절히 응답하도록 설계되었습니다. 

모델은 학습 과정에서 데이터 간의 관계를 분석합니다. 예를 들어 문맥에서 단어들이 어떻게 함께 나타나는지를 파악하고, 이러한 이해를 바탕으로 응답을 생성할 때 가장 가능성이 높은 다음 단어를 한 단어씩 예측합니다. 텍스트는 '토큰'이라고 불리는 더 작은 단위로 변환될 수 있으며, 토큰은 전체 단어, 단어의 일부, 또는 문장 부호를 나타낼 수 있습니다. 토큰은 모델이 처리하는 텍스트의 기본 구성 단위입니다. 이미지와 같은 다른 형태의 콘텐츠를 생성하는 모델도 마찬가지로, 픽셀 간의 관계와 학습 데이터에 포함된 설명과의 연관성을 학습합니다.

예를 들어 모델의 학습 과정("훈련"이라고 함) 중에는 “왼쪽으로 도는 대신, 그녀는 ___.”과 같은 문장을 완성하는 작업이 주어질 수 있습니다. 훈련 초기에는 모델의 응답이 대부분 무작위적입니다. 그러나 많은 텍스트를 처리하고 학습함에 따라 패턴을 더 잘 인식하고 다음에 올 가능성이 높은 단어를 예측하는 능력이 향상됩니다. 이 과정은 수백만 개의 문장에서 반복되며 모델의 이해도와 정확도를 높입니다.

문장을 완성할 수 있는 방식이 “왼쪽으로 도는 대신 오른쪽으로 돌았다,” “주위를 돌았다,” “뒤로 돌았다”처럼 여러 가지로 타당하게 존재하기 때문에, 모델이 응답하는 방식에는 본질적으로 어느 정도의 무작위성이 포함됩니다. 따라서 동일한 질문에 대해 다른 요청에서 서로 다른 답변이 생성될 수 있습니다.

머신 러닝 모델은 “가중치” 또는 “파라미터”라고 불리는 방대한 숫자 집합과 해당 숫자를 해석하고 사용하는 코드로 구성됩니다. 이 모델들은 훈련 데이터의 사본을 저장하거나 보유하지 않습니다. 대신 모델은 학습 과정에서 파라미터 값을 조정하여 학습한 패턴을 반영합니다. 앞선 예시에서 모델은 훈련 문장을 저장함으로써가 아니라 내부 파라미터를 업데이트함으로써 무작위 단어를 예측하던 단계에서 더 정확한 예측을 수행하는 단계로 향상되었습니다. 모델은 훈련 중 처리한 문장, 이미지, 오디오의 사본을 보관하지 않습니다. ChatGPT는 학습 데이터에서 “복사하여 붙여넣기”를 하지 않으며, 이는 교사가 오랜 기간 학습한 후 원본 자료를 문자 그대로 암기하거나 재현하지 않고도 개념 간의 관계를 이해해 설명할 수 있는 것과 유사합니다. 모델은 사용자 요청에 대한 응답을 생성할 때 학습된 가중치를 사용하여 새로운 콘텐츠를 예측하고 생성합니다.

ChatGPT 학습에는 어떤 정보가 사용되나요?

공개된 인터넷 콘텐츠의 경우, 인터넷에서 자유롭고 공개적으로 접근할 수 있는 정보만 사용합니다. 공개 웹페이지, 공개 포럼, 공개 블로그, 공개 게시물 및 기타 공개적으로 이용 가능한 온라인 콘텐츠가 여기에 포함될 수 있습니다. 예를 들어 공개 온라인 토론 포럼에 참여하거나 공개 블로그 글 또는 기타 게시물을 게시한 경우, 해당 콘텐츠가 모델 학습에 활용될 수 있습니다. 단, OpenAI는 학습 과정에서 개인정보 처리를 최소화하기 위한 조치를 취하고 있습니다.  공개 인터넷 콘텐츠를 수집할 때 유료 구독 뒤에 있는 것으로 알려진 출처나 다크 웹의 데이터는 의도적으로 수집하지 않습니다. 또한 혐오 발언, 성인 콘텐츠, 개인정보를 수집 및 집계하는 사이트, 스팸과 같이 모델이 학습하지 않도록 하려는 콘텐츠는 필터를 적용해 제거합니다. 그런 다음 나머지 정보를 사용하여 모델을 학습합니다. 

웹사이트 소유자는 robots.txt와 같은 표준 웹 제어 수단을 사용해 GPTBot(모델 학습을 위해 공개 콘텐츠를 크롤링하는 봇)을 차단함으로써 자신의 사이트 콘텐츠가 학습에 활용되지 않도록 관리할 수 있습니다. 웹사이트 소유자가 자신의 사이트와 AI 시스템 간의 상호작용을 관리할 수 있도록 안내를 제공하고 있습니다. 

제3자 파트너가 제공하는 정보도 모델 학습 및 개선에 활용됩니다. 여기에는 제3자와의 계약을 통해 접근하는 데이터 세트, 그리고 정책 및 계약에 따라 허용되는 경우 인간 트레이너와 연구자가 제공하거나 생성한 정보가 포함될 수 있습니다. 이는 모델의 품질, 안전성, 성능 향상에 도움이 됩니다. 데이터 세트에 따라 텍스트, 이미지, 오디오, 영상 등 다양한 유형의 데이터가 포함될 수 있습니다.

일부 학습 과정에서는 합성 데이터도 점점 더 많이 활용되고 있습니다. 예를 들어 합성 프롬프트, 다국어 예시, 기타 학습 자료를 생성하는 데 모델과 정보를 함께 활용할 수 있습니다. 합성 데이터는 데이터가 부족하거나 불균형한 영역을 보완해 모델 성능을 높이는 데 도움이 되며, 개인정보 보호를 강화하는 방식의 모델 개발도 지원할 수 있습니다.

ChatGPT를 학습시키는 데 개인정보가 사용되나요?

온라인 콘텐츠의 상당 부분이 사람에 대한 정보를 포함하고 있기 때문에, 학습 데이터에 개인정보가 포함될 수 있습니다. 그러나 학습 과정에서 개인정보 처리를 최소화하기 위한 조치를 적극적으로 취하고 있습니다.

학습 데이터는 예측, 추론, 문제 해결 등 모델의 기능을 개발하는 데 사용되며, 개인 프로필 구축, 개인 연락, 맞춤형 광고 제공에는 사용되지 않습니다.

일부 경우 모델은 언어에서 이름이나 주소 같은 요소가 어떻게 기능하는지 이해하거나 공인 및 잘 알려진 엔티티를 인식하기 위해 개인정보로부터 학습할 수 있습니다. 이는 모델이 더 정확하고 문맥에 맞는 응답을 생성하도록 돕습니다.

학습 중 개인정보는 어떻게 보호되나요?

OpenAI는 학습 과정에서 개인정보 처리 범위를 제한하기 위해 적극적인 조치를 취하고 있습니다. 예를 들어, 대량의 개인정보를 집계하는 것으로 알려진 출처를 제외하고, 필터링을 통해 학습 데이터 내 개인정보를 줄이며, 중복 콘텐츠를 식별하고 제거해 학습 데이터가 그대로 반복될 위험을 낮춥니다. 또한 개인에 관한 비공개 또는 민감한 정보 요청에는 응답하지 않도록 모델을 학습시키고 있습니다. 

정보 보유 기간

이 문서와 개인정보 보호 정책에 명시된 목적, 즉 모델 개발 및 개선, 관련 과학 연구를 위해 합리적으로 필요한 기간 동안에만 학습 데이터의 정보를 보관합니다. 보유 기간은 지속적인 필요성을 확인하기 위해 정기적으로 검토되며, 정보의 유형과 활용 방식에 따라 달라집니다. 보유 기간 결정 시에는 처리 목적, 정보의 양과 성격 및 민감도, 무단 사용 또는 공개로 인한 잠재적 피해 위험, 법적 의무 등을 종합적으로 고려합니다.

ChatGPT 개발은 어떻게 개인정보 보호법을 준수하나요?

학습 정보는 관련 법률에 따라 적법하게 사용합니다. OpenAI의 파운데이션 모델은 접근성 도구, 고객 지원, 소프트웨어 개발, 맞춤형 교육, 과학 연구 등 다양한 분야에서 유익한 활용 사례를 지원합니다. 이러한 기능은 공개적으로 이용 가능한 정보와 제3자 파트너 정보를 포함한 대규모 학습 데이터를 기반으로 합니다. 이 문서에 설명된 바와 같이 학습 과정 전반에 걸쳐 개인정보 처리를 줄이고 위험을 완화하기 위한 보호 조치를 적용합니다. 학습 데이터에 포함된 개인정보의 수집 및 사용은 GDPR 등 개인정보 보호법상 정당한 이익에 근거합니다. 여기서 정당한 이익에는 모든 사람이 범용 인공지능의 혜택을 누릴 수 있도록 한다는 사명에 따라 사용자와 사회 전체를 위해 모델을 학습하고 개선하는 것이 포함됩니다. 자세한 내용은 개인정보 보호 정책을 참조하세요. 또한 해당 정보를 합법적이고 책임감 있게 수집하고 사용하는지 확인하기 위해 데이터 보호 영향 평가를 완료했습니다.

정보가 공유 또는 이전될 수 있는 경우

개인정보는 '판매'하지 않으며, 학습 데이터에 포함된 개인정보는 개인정보 보호 정책에 명시된 제한적인 경우에만 공개합니다. 예를 들어 모델의 개발, 테스트, 개선을 지원하는 계열사, 공급업체, 서비스 제공업체와 정보를 공유할 수 있습니다. 또한 법적 의무 준수 또는 OpenAI와 사용자, 직원, 대중의 권리, 안전, 보안 보호를 위해 필요하다고 선의로 판단되는 경우, 개인정보 보호 정책에 설명된 바와 같이 정보를 공개할 수 있습니다.

OpenAI의 인프라는 전 세계에서 운영되므로 학습 데이터에 포함된 개인정보가 EEA, 스위스, 영국 이외의 국가(미국 포함)에서 처리될 수 있습니다. 이 경우 개인정보 보호 정책에 설명된 바와 같이 적정성 결정 또는 표준 계약 조항 등 적절한 보호 조치를 적용합니다.

사용자의 권리와 행사 방법

OpenAI는 이의 제기 요청 및 유사한 권리 요청에 대응합니다. 언어 학습의 특성상 ChatGPT 응답에는 공개 인터넷에 여러 차례 등장하는 개인(예: 공인)에 대한 개인정보가 포함될 수 있습니다. 일부 관할 지역의 개인은 프라이버시 포털을 통해 모델의 개인정보 처리에 대해 이의를 제기하거나 기타 정보 주체 권리를 행사할 수 있습니다. 또한 privacy@openai.com으로 문의하여 이러한 권리를 행사할 수 있습니다. 

요청을 검토하고 처리할 수 있도록 요청과 관련된 개인정보를 파악하는 데 필요한 충분한 정보를 제공해 주세요. 이름, 관련 URL, 모델 출력의 구체적인 예시, 또는 문제 파악에 도움이 되는 기타 세부 정보가 포함되면 도움이 됩니다. 경우에 따라 조치를 취하기 전에 신원 확인이나 정보의 본인 관련 여부 확인을 요청할 수 있습니다. 요청 제출 방법, 모범 사례, 검토 절차에 대한 자세한 내용은 ChatGPT 개인 데이터 삭제에 관한 도움말 센터 문서를 참조하세요. 모든 요청은 관련 개인정보 보호법에 따라 검토되며 법정 기한 내에 응답합니다.

개인정보 보호법에 따라 일부 권리는 절대적인 권리가 아닐 수 있습니다. 예를 들어 관련 정보를 확인할 수 없거나, 요청이 OpenAI가 처리하는 개인정보와 관련이 없거나, 예외 사항이 적용되거나, 기타 적법한 사유가 있는 경우 요청을 이행하지 못할 수 있습니다. 요청은 개별 사안별로 검토되며, 개인정보 보호 권리와 표현의 자유, 공익 등 다른 중요한 가치 간의 균형을 고려해 처리됩니다. 

그럼에도 OpenAI는 불구하고 개인정보 보호를 최우선으로 하며, 적용되는 모든 개인정보 보호법을 준수하기 위해 노력합니다. 문제가 충분히 해결되지 않았다고 판단되는 경우, 관할 감독 기관에 불만을 제기할 권리가 있습니다.

웹사이트, 애플리케이션 및 서비스를 이용할 때 수집되는 개인정보와 관련된 OpenAI의 처리 방식에 대한 자세한 내용은 개인정보 보호 정책을 참고하세요.

이 문서가 도움이 되었나요?