"공개되어 있다"가 곧 마음대로 긁어 학습시켜도 된다는 뜻이라 가정하는 것
보이는 것과 허락된 것은 같은 말이 아니다. 사람들은 그 차이를 배우려고 계속 변호사 비용을 낸다.
이것은 법률 자문이 아닙니다. 샐리는 특정한 당신의 상황이 아니라 일반적인 행동과 사용 사례를 비꼬며, 여기 있는 어떤 것도 진짜 변호사를 대신하지 않습니다. 사례는 실제이지만, 그에 대해 무엇을 할지는 당신과 그것을 말해 줄 자격이 있는 사람 사이의 문제입니다.
공개된 것은 공정한 사냥감이라는 논리로, 개인정보를 포함한 공개 웹 데이터를 대량으로 긁어 학습 데이터셋을 만드는 것.
Clarkson Law Firm class actions v. OpenAI / Google
No. 3:23-cv-03199 (N.D. Cal., 2023) · US (N.D. California)
집단소송들은 동의 없이 수십억 단어와 사용자 개인 데이터를 긁어 모델을 학습시킨 것이 프라이버시 권리를 침해했다고 주장했다.
절차적으로 어려움을 겪어 축소되거나 취하되어 본안 승소는 아니다. 첫 대형 "긁기는 곧 프라이버시 침해" 논리로서 의미가 있다. 논리를 세운 사례로 인용하라.
대규모 집단소송들이, 동의 없이 수십억 단어와 개인 정보를 긁어 모델을 학습시키는 것이 프라이버시와 데이터 권리에 저촉된다는 논리를 펼쳤다. 그 특정 소송 일부는 절차상 무너졌으니 승리가 아니라 논리를 세운 사례로 다뤄라. 하지만 그 논리 자체는 이제 확실히 테이블 위에 올라와 있다.
공개적으로 보인다는 건 접근에 관한 것이지 허락에 관한 게 아니다. 사진, 게시물, 프로필에 닿을 수 있다는 사실은 그것을 상업용 모델에 집어넣어도 되는지에 대해 아무것도 말해주지 않는다. 그 두 번째 질문에는 자체 규칙이 있고, 그 규칙은 점점 빡빡해지고 있다.
“당신은 그게 다 정리된 것처럼 공개 데이터라고 불렀다. 원고들은 그걸 자기 개인정보라고 불렀고, 변호사를 데려왔다.”
- 01당신의 학습 데이터가 실제로 어디서 왔는지, 그리고 그것을 그렇게 쓸 권리가 당신에게 있는지 지도로 그려라.
- 02"닿는 대로 긁었다"보다 라이선스를 받았거나, 동의를 얻었거나, 명확히 허락된 출처를 우선하라.
- 03공개된 장소의 개인정보도 여전히 의무를 동반한다고 가정하라. 대개 그렇다.
법률 자문이 아닙니다. 당신의 상황이 아니라 사용 사례에 대한 일반적인 논평입니다. 행동하기 전에 진짜 변호사와 상담하세요.