Home

읽기 설정

AI 시간입니다. 여러분의 데이터가 어디 있는지 아세요?00:00

글쎄요, 그렇게 생각하신다고 해도 아마 그렇지 않아요.00:03

아닐 가능성이 높습니다. 대부분의 조직과 마찬가지로 귀하의 민감한 데이터가 이미 노출되었을 수 있어요,00:06

그리고 AI는 문제를 더욱 악화시키고 있습니다. 코앞에서 일어나고 있지만, 보이지 않아요. 제가 말씀드리는 뜻은요.00:11

AI 도입 속도는 기존 보안 접근 방식이 보호할 수 있는 것보다 빠릅니다.00:18

최근 한 연구에 따르면 조직의 31%가00:23

AI 관련 사고로 인해 데이터 개인 정보 침해를 경험했습니다.00:28

섀도우 AI 프로젝트와 같은 경우도 있습니다. 기본적으로 승인되지 않은 AI가 내부에서 배포되는 것이죠.00:32

환경입니다. 이러한 것들은 종종 저희 정책이 규정해야 하는 보안 제어가 부족합니다.00:39

그리고 공개 클라우드 챗봇 사용도 있습니다. 사람들이 질문을 하러 들어가는 것들이죠,00:46

하지만 민감한 정보가 담긴 스프레드시트가 포함될 수도 있어요.00:53

일단 공개 채팅 봇으로 들어가면 사실상 공개 정보가 돼요.00:57

민감한 정보를 모델 학습에 사용할 수 있고, 그러면 누구나 이용할 수 있게 되는 거죠.01:02

그래서 AI가 이것을 어떻게 사용하는지에 대한 몇 가지 질문에 답해야 해요.01:08

가장 먼저, AI는 어떤 데이터를 사용했나요?01:14

어디서 그 데이터를 얻었을까요?01:19

궁극적으로, 어떻게 AI 데이터 노출을 선제적으로 관리할 건가요?01:22

기존의 DLP, 즉 데이터 유출 방지 도구와 AI 툴로는 이 질문에 답할 수 없어요.01:29

다른 접근 방식이 필요할 거예요. 어떤 AI 툴을 사용하고 있는지 아는 것만으로는 충분하지 않아요. 물론 좋은 시작점은 되겠죠.01:35

또한 민감한 데이터가 AI 시스템을 통해 어떻게 흘러가는지, 그리고 어디에 노출될 수 있는지 알아야 해요.01:42

제가 말씀드리는 바를 이해할 수 있도록 간단한 아키텍처를 살펴보겠습니다.01:48

특정 모델로 학습하기 위해 학습 데이터가 입력됩니다.01:52

그다음 사용자가 프롬프트를 입력하면 AI로 들어가서 다른 작업을 수행하게 됩니다.01:59

프롬프트와 함께 다른 데이터 소스를 활용하여 검색 증강 생성과 같은 작업을 할 수도 있습니다.02:05

그리고 이 모든 것을 덮어쓰는 컨텍스트나 정책이 있을 가능성이 높습니다.02:12

그 안에는 민감한 정보가 포함될 수도 있습니다.02:18

AI가 어떻게 작동하고 답변을 생성해야 하는지에 대한 정보를 담고 있는 거죠.02:20

에이전트라면 다양한 도구를 활용하기도 합니다.02:26

일부 도구는 코드를 작성하거나 데이터베이스에 접근할 수 있습니다.02:31

또 다른 에이전트를 생성하고, 그 에이전트가 또 다른 에이전트를 생성하기도 합니다.02:35

좋아요, 정보가 흐르는 일반적인 과정과 다양한 구성 요소들이 어떻게 상호 작용하는지입니다.02:40

데이터 관점에서 보면 어떨까요? 여기에서 무엇이 민감할 수 있을까요? 음, 우리는 민감한 정보를 가지고 있을 수도 있습니다.02:47

여기 훈련 데이터가 모델에 입력되고 있습니다.02:53

사용자가 프롬프트와 함께 입력하는 민감한 정보가 있을 수도 있습니다.02:57

스프레드시트나 문서를 사용해서 민감한 정보가 있을 수도 있고, 그 정보는03:04

프롬프트와 함께 AI에 입력되기도 하고요.03:11

정책이나 컨텍스트에 민감한 정보가 있을 수도 있어요.03:14

경쟁 우위라고 생각하는 업무 방식일 수도 있고요.03:18

경쟁사에게 알려주고 싶지 않으므로 이것 또한 모델에 입력되고 있습니다.03:21

그럼 모델이 도구를 사용해서 외부로 연결하고 있습니다.03:28

이 도구들은 어떨까요? 어떤 정보들을 처리하고 있나요?03:31

정보를 보호하고 있을까요, 아니면 그렇지 않을까요? 해당 도구들에 대한 통제권과 가시성이 있을까요?03:36

데이터베이스에 쓰고 있다면, 그 데이터가 어디로 흘러갈지 알 수 있을까요?03:41

아마 하위 단계에서도 다른 곳으로 흘러갈 수도 있겠죠.03:46

그리고 제가 잠재적으로 민감한 정보를 받아 에이전트에 전달하는 경우에요.03:49

이 에이전트들이 또 다른 에이전트를 생성하기도 하거든요.03:56

보시다시피 민감한 정보가 여기저기 흩어져 있고, 전체 아키텍처를 통해 흐르고 있어요.04:00

아키텍처 전체에 걸쳐요. 따라서 이 경우에는 고려해야 할 사항이 많습니다.04:07

가장 먼저, AI에서 어떤 민감한 데이터가 사용되고 있는지 알아야 합니다.04:12

그리고 노출 범위는 어느 정도인지도 알아야 합니다.04:18

어떤 데이터가 노출되고 있나요? 권한이 있었고 관리되었나요?04:22

그럼 어떻게 조사해야 할까요?04:26

데이터가 AI를 통과하는 동안 무슨 일이 일어났나요?04:30

결국 어떻게 AI 도입을 가능하게 할까요?04:33

데이터 보안 격차를 만들지 않고서 말이죠. 그렇게 하기 위해서는04:38

몇 가지 다른 기능을 수행해야 할 필요가 있는데, 데이터를 어디로 가는지 확인해 보려고 합니다.04:45

데이터가 어디로 향하는지 살펴볼 텐데, 몇 가지 다른 관점에서 살펴볼게요. 워크로드 스트림이 있는데04:47

기본적으로 AI 시스템 내부에 있는 워크로드 스트림과 직원의 AI 사용을 나타내는 워크포스 스트림이 있습니다.04:52

직원이 AI를 사용하는 것을 의미하며, 제가 해야 할 일은 모니터링하고 추적한 다음04:58

데이터가 시스템을 통해 어떻게 이동했고 어떻게 사용되었는지 보여줄 수 있어야 합니다.05:04

노출되었으니 워크로드 예시부터 살펴볼게요. AI 시스템 내부에 들어가서05:09

AI 앱 내부를 살펴보고 데이터를 어떻게 사용하는지 확인해야 해요.05:15

RAG 파이프라인을 살펴봐야 하고 어떤 정보가 그 방식으로 시스템에 들어오는지 확인해야 해요.05:19

생성형 AI 모델의 핵심인 벡터 데이터베이스를 살펴볼 거예요.05:26

이 모든 것을 추적할 수 있어야 해요. 데이터 변환도 발생할 거예요.05:31

정보는 이랬는데, 이제 다른 형태로 바뀌었죠. 그래도 그걸 알아야 해요.05:36

이 형태만 찾고 있다면 놓칠 수도 있고...05:42

데이터가 유출되었음을 알아차려야 해요. 그래서 데이터가 변환되었을 때를 알아챌 수 있어야 해요.05:46

그리고 이걸 모두 보여줄 수 있어야 해요. 데이터가 어디에서 왔는지 출처를 보여줄 수 있어야 해요.05:52

방금 언급했던 이러한 변환 과정을 보여줄 수 있어야 해요.05:58

결국 이 모든 정보는 어디로 흘러가는 걸까요?06:02

그래서 이것은 AI 내부의 관점입니다. 인사 담당자 관점에서는 어떨까요?06:06

직원들의 업무 환경을 살펴봐야 합니다. 이 경우에는 파일 업로드와 다운로드를 확인하고 싶고, 무엇을06:10

시스템에 넣은 것과 시스템에서 꺼낸 것을 보고, 복사-붙여넣기 작업을 언제 했는지 확인하고 싶습니다.06:17

어쩌면 민감한 정보를 가져와 다른 곳에 붙여 넣었을 수도 있습니다.06:23

데이터가 이제 다른 곳에 저장되었음을 알 수 있습니다. 자식 정보도 확인해야 합니다.06:28

메인 파일이 있고, 거기에서 파생된 자식 파일들이 있으며, 그리고06:34

원본에 민감한 정보가 포함된 파일과 마찬가지로 이 모든 것을 추적할 수 있어야 합니다.06:40

직원들이 이 정보를 어떻게 활용하는지 보여줄 수 있어야 합니다06:47

그리고 다른 직원들과 어떻게 공유하고 있는지 확인해야 합니다.06:52

그래서 이런 모든 것들을 확인해야 하고, 통합된 엔드투엔드 가시성 보호06:56

플랫폼이 필요해요. 무엇을 봐야 할까요? 데이터의 흐름을 파악할 수 있어야 해요.07:04

데이터가 어디에서 왔고 시스템 내에서 어떻게 이동했는지도 확인해야 해요.07:09

소스부터 시작해서 이 AI를 거쳐서 엔드포인트 시스템에 도착하는 과정까지 확인할 수 있어야 해요.07:15

이 모든 것을 포괄하는 정책도 필요해요.07:22

이 두 가지 모두에 공유되고 모니터링 및 시행되는 정책이죠.07:26

모든 것을 모니터링할 수 있는 단일 화면도 필요해요.07:31

통합되지 않은 여러 모니터 시스템을 사용할 여유는 없어요. 그러면 알 수 없을 테니까요.07:37

궁극적으로 위험을 식별할 수 있어야 해요.07:44

사전에 이 위험을 파악할 수 있는 기능이 필요해요.07:48

데이터가 유출된 후에가 아니라, 제가 방금 말씀드린 그런 가시성을 어떻게 얻을 수 있을까요?07:53

자, 이 문제를 다양한 관점에서 살펴볼 세 가지 렌즈, 즉 서로 다른 도구를 살펴보겠습니다.07:59

먼저 Gentic 플랫폼 검색부터 시작하겠습니다.08:06

이런 작업을 수행하는 도구들은 누가 어떤 모델을 프롬프트했는지,08:09

어떤 모델이 사용되었고 어떤 에이전트가 실행되었으며 어떤 MCP 도구가 호출되었는지 알 수 있습니다.08:14

그래서 그것들이 특히 잘하는 일이죠.08:19

그러면 엔드포인트 DLP, 데이터 유출 방지 디스커버리 도구 관점에서 이것을 살펴볼 수도 있어요.08:22

그런 도구들은 존재하고, 어떤 에이전트와 확장 프로그램, 그리고 MCP 서버가08:29

각 장치에 어떤 에이전트와 확장 프로그램, MCP 서버가 있는지 알려줄 수 있어요. 파일이나 메모리도요.08:34

아마 엔드포인트 장치에 있는 다른 디지털 잔여물도 있을 수 있겠죠.08:39

세 번째 관점은 클라우드이거나 온프레미스 검색일 수 있습니다.08:42

그리고 이것은 특정 플랫폼에 어떤 데이터 소스가 있는지 알려줄 것입니다.08:48

데이터의 분류와 민감도, 그리고 소유권까지 파악할 수도 있습니다.08:53

좋은데, 하지만09:00

문제를 보셨나요? 각각이 그림의 일부만 보여줍니다.09:02

그래서, 우리에게 정말로09:07

필요한 것은 이 모든 것을 고려하고 모두 통합하여 단일 뷰를 제공하는 전체적인 관점입니다.09:08

AI에서 데이터 노출을 관리하기 위해 무엇이 정말로 필요할까요?09:15

요구 사항을 살펴보겠습니다.09:22

먼저, AI 인지 자동 데이터 분류 및 검색 시스템에 대해 이야기하겠습니다.09:24

시스템이 계속 변하기 때문에 지속적으로 이루어져야 해요.09:31

모든 플랫폼의 소스를 인식해야 하고, 우리가 가지고 있는 민감한 데이터에 대한 인지 능력도 필요해요.09:36

개인 식별 정보, 개인 건강 정보 같은 민감한 데이터를 말이죠.09:42

금융 데이터, 지적 재산, 그런 종류의 모든 것들이요.09:47

다음으로 필요한 것은 계보 기반 위험 가시성을 보여주는 것입니다.09:52

그래서 데이터는 RAG에 의해 변환되죠,09:58

AI 에이전트나 시스템 같은 것들도 변환을 할 수 있어요.10:01

그리고 데이터가 시스템 전체를 통해 어떻게 전파되는지 확인해야 하고, 어떤 경우에는 전파되면서 변경될 수도 있어요.10:07

마지막으로 지능형 조사 기능이 필요해요.10:14

사용자 민감도, 목적지 등을 기반으로 상황 인지가 되어야 해요.10:18

그리고 다른 여러 요인들도 고려해야 하고, 조사 시간을10:25

일반적으로 몇 주에서 며칠로 단축할 수 있어야 해요.10:31

빠르게 움직여야 하고, 궁극적으로는 규정 준수 보고서도 필요해요.10:34

고려해야 할 사항이 정말 많아요. GDPR, 일반 데이터 보호 규정10:39

EU AI 법, SOC 2, ISO 27001, HIPAA 등 목록은 계속 이어져요.10:45

저희의 AI가 어떻게 규정을 준수하는지 모든 것을 파악할 수 있어야 해요.10:51

데이터는 AI의 생명줄과 같아요. 계속 움직여야 하는데, 그렇지 않으면 환자가 죽죠. 하지만 어디로 가는지 모니터링하지 못하면10:57

몸에서 출혈이 발생하고도 인지하지 못할 수도 있어요.11:04

시스템은 복잡하지만, AI로부터 데이터 노출을 관리하는 데 도움이 되는 도구들이 있어요.11:07

이게 좋은 소식이죠. 더 자세히 알고 싶으시면 아래 설명에 있는 링크를 확인해 보세요.11:13

AI Summary

AI 시대에 맞춰 데이터 노출 위험이 심화되고 있어서, 기존의 보안 시스템으로는 대응하기 어렵습니다. 따라서 AI가 사용하는 데이터의 출처와 활용 방식을 파악하고 관리하는 것이 중요하며, 데이터 흐름 추적 및 가시성 확보를 통해 직원들의 활동까지 감시해야 합니다. 다양한 도구를 통합하여 단일 뷰로 데이터 흐름을 한눈에 파악할 수 있는 솔루션이 필요하며, AI 인지 자동 분류 시스템 구축, 계보 기반 위험 가시성 확보, 지능형 조사 기능, 규정 준수 보고서 작성 등의 요구 사항을 충족해야 합니다.

Key Highlights

  • •AI 도입으로 인한 데이터 노출 위험 증가
  • •데이터 흐름 추적 및 가시성 확보의 중요성
  • •다양한 도구 통합을 통한 단일 뷰 필요
  • •AI 인지 자동 분류 시스템 구축
  • •규정 준수 보고서 작성

Related Videos