TL;DR
- AI가 좋다는 평가는 무엇을 잘하는지, 누구에게 좋은지, 어떤 조건에서 작동하는지에 따라 달라짐.
- ‘좋음’은 대상의 종류에 따라 기준이 달라지는 개념이므로, 특정 업무에서의 성과를 다른 역할이나 상황의 우수성으로 일반화할 수 없음.
- 코딩 에이전트의 가치는 코드 생성 속도뿐 아니라 요구사항 파악, 기존 시스템 이해, 정확성, 유지보수성, 신뢰성 등 프로그래밍 업무 전반을 기준으로 판단해야 함.
- 평가에는 업무의 목적과 환경, 성공 기준, 측정 결과, 허용 가능한 실패 범위가 포함돼야 함.
- 기술이나 도구를 평가할 때는 무엇을 잘하는지, 누구를 위한 것인지, 무엇과 비교하는지, 어떤 조건에서 평가하는지를 물어야 함.
‘좋음’은 대상에 따라 기준이 달라지는 개념
- AI에 관한 논의에서 ‘좋다’는 말은 대체로 신뢰성, 안전성, 사회적 유익성, 도덕적 바람직성 등 서로 다른 의미로 사용됨. 같은 AI 시스템을 두고 평가하는 사람들이 서로 다른 기준을 적용할 수 있음.
- 철학자 Bernard Williams는 저서 『Morality』의 ‘Good’ 장에서 ‘좋음’의 의미를 다룸. ‘빨간 자동차’와 ‘빨간 차량’은 같은 색을 가리키지만, ‘좋은 축구 선수’라고 해서 ‘좋은 인간’이라는 결론이 따라오지는 않음.
- 어떤 사람을 좋은 의사로 만드는 특성은 좋은 칼이나 좋은 축구 선수를 만드는 특성과 다름. 따라서 ‘좋음’이라는 말을 대상의 종류와 분리해 다른 대상에도 같은 기준을 적용할 수 없음.
- 비교만으로도 우수성을 정의하기 어려움. Smith가 대부분의 축구 선수보다 낫다고 해도, 좋은 축구 선수의 기준이 무엇인지 정하지 않으면 Smith가 얼마나 좋은 선수인지 알 수 없음. 다만 명확한 기준과 기준선이 있다면 비교는 유용할 수 있음.
AI의 여러 업무 수행이 역할 전체의 우수성을 뜻하지 않음
- ABC라는 AI 에이전트가 소프트웨어, 에세이, 사업 보고서, 의료 요약문, 법률 메모를 작성한다고 해서 좋은 프로그래머, 작가, 사업 분석가, 변호사라고 추론할 수는 없음.
- 많아야 특정 상황에서 각 역할과 관련된 일부 업무를 잘 수행한다고 볼 수 있으며, 이는 해당 역할 자체에 능숙하다는 뜻과 다름.
- 코딩 에이전트가 많은 코드를 빠르게 생성하더라도 프로그래밍은 코드 작성 속도만으로 이뤄지지 않음. 요구사항 명확화, 기존 시스템 이해, 회사 내 여러 역할과의 협업, 절충점과 정확성에 대한 추론, 유지보수성과 신뢰성에 대한 고려도 포함됨.
- 프로그래머의 업무에는 사람 교육과 지식 전달, 고객 응대, 아이디어 전달, 과거 경험의 활용, 잘못됐다고 판단한 사안에 대한 반대 의견 제시, 더 나은 접근법에 대한 동료 설득도 포함될 수 있음.
업무와 환경에 따라 달라지는 좋은 결과
- AI가 무엇을 잘하는지만으로 평가는 충분하지 않을 수 있음. 결과의 적절성은 업무의 성격과 목적, 수행 이유, 사용자, 환경에 따라 달라질 수 있음.
- 무엇을 측정하는지, 어떤 실패를 허용하는지도 중요함. 빠르게 폐기할 시제품을 만드는 스타트업에서 엔지니어가 검증을 거의 하지 않고 간단한 스크립트를 작성하는 일은 괜찮을 수 있음. 반면 수백만 명이 사용하는 소프트웨어를 검증 없이 출시하는 일은 신뢰하기 어려움.
- ‘좋다’는 말을 들으면 ‘무엇을 잘하는가?’라고 물을 수 있음. 빠른 시제품 제작에 적합한 코딩 에이전트와 신뢰할 수 없는 코드에서 문제를 찾도록 보안 연구자를 돕는 에이전트는 서로 다른 기준으로 평가해야 함.
- 패치를 빠르게 만들어 당장의 문제를 해결하는 에이전트가 장기적으로 패치를 유지보수해야 하는 팀에도 적합한 것은 아님. 특히 팀의 감독 없이 사용된다면 더욱 그러함.
평가 기준과 맥락을 함께 확인해야 함
- 오랫동안 함께 식사해 온 친구들은 식당을 ‘좋다’고 말할 때 구체적인 기준을 나열하지 않아도 서로의 경험으로 맥락을 공유함. 문제는 한 맥락에서 나온 평가를 다른 맥락으로 옮길 때 발생함.
- 공급업체가 자사 제품이 특정 업무에 좋다고 주장할 수 있지만, 업무와 환경, 성공 및 실패 기준이 완전히 다른 팀이 그 제품도 자신들에게 적합하다고 가정해서는 안 됨.
- Williams의 논의에 따르면 어떤 것이 좋은 ‘x’인지 판단하려면 x가 어떤 종류의 대상인지, 무엇을 하는지, 해당 대상에 관한 관련 사실이 무엇인지 이해해야 함. 이를 통해 적어도 대체로 그 주장이 참인지 거짓인지 판단할 수 있음.
- 기술과 도구를 평가하는 팀은 의미 있는 업무와 기준선, 성공 기준, 허용 가능한 실패 조건을 선택할 만큼 업무와 기술을 모두 이해해야 함.
- 기술이나 도구가 좋다고 말하기 전에 무엇을 잘하는지, 누구를 위한 것인지, 무엇과 비교하는지, 어떤 조건에서 평가하는지, 어떤 결과를 측정하며 어떤 실패를 용납할 수 없는지 물어야 함.
댓글 (0)
로그인하면 이 기사에 내 생각을 남길 수 있어요