TL;DR
- Omneky가 8개 이미지 모델을 4개 브랜드·5개 언어의 실제 광고 브리프 59개로 평가한 Taste Bench에서 광고 점수와 즉시 집행 가능성을 비교함.
- 모델별 광고 점수는 6.4~7.4점, 즉시 집행 가능 비율은 22~54%이며, 종합 1위는 GPT Image 2.5 Flare임.
- 평가 기준은 미적 완성도뿐 아니라 로고·제품·문구·언어·규정 준수·플랫폼 화면 가림 여부를 포함함.
- 브리프 유형과 언어별 최고 모델이 다르며, 모든 상황에서 이기는 단일 모델은 없음.
- 모델을 공개된 동일 조건과 블라인드 심사로 비교하고, 새 이미지 모델이 출시될 때마다 벤치마크를 갱신함.
Taste Bench · 이미지 광고 · 2026년 9월
- Taste Bench의 표어는 “이미지는 어떤 AI든 만들 수 있지만, 광고를 광고답게 만드는 것은 감각”임.
- 8개 이미지 모델, 4개 브랜드, 5개 언어의 실제 광고 브리프 59개를 바탕으로 광고 469개를 생성하고 블라인드 심사 1,371회를 진행함.
- 점수는 로고, 제품, 문구, 시장 적합성 등 광고의 성패를 좌우하는 요소를 다룸. 해당 평가는 Omneky가 만드는 광고의 검토 절차를 위한 기반임.
- 페이지 최종 갱신일은 2026년 9월 24일이며, 새 모델이 출시되면 평가를 다시 진행함.
리더보드
- 동일한 브랜드 키트와 브리프를 사용하고, 모델마다 한 번씩 생성한 결과를 세 명의 심사자가 블라인드 평가함.
- 리더보드에는 브리프 조건 선택지가 있음: 시작 조건, 프롬프트 없음, 간단한 아이디어, 붙여 넣은 프롬프트, 상세 브리프, 정확한 문구, 이미지 전용, 스토리·피드, 전체 브랜드 키트. 언어 선택지는 영어, 일본어, 아랍어, 힌디어, 스페인어임.
- 전체 모델 결과는 다음과 같음.
- GPT Image 2.5 Flare(OpenAI): 광고 점수 7.4, 즉시 집행 가능 42%
- GPT Image 2.5 Sunburst(OpenAI): 7.4, 54%
- GPT Image 2(OpenAI): 7.4, 37%
- Nano Banana Pro(Google): 7.2, 32%
- Grok Imagine 2.0(xAI): 7.1, 30%
- Nano Banana 2(Google): 7.0, 32%
- Muse Image(Meta): 7.0, 34%
- Seedream 5 Pro(ByteDance): 6.4, 22%
- 이 결과는 Omneky의 자체 검토 단계를 끈 상태에서 얻은 첫 시도 결과로, 모델 간 공정한 비교를 위한 조건임.
- Grok Imagine 2.0은 입력 이미지 허용량을 초과하는 브리프 3개를 처리하지 못함.
- 각 행은 하나의 브리프에 해당하며, 해당 행의 모든 모델은 같은 브리프와 입력 자료를 받음. 브리프 예시는 Asarai의 점토 마스크, Boco to Deco의 일본어 광고, Jobber의 현장 서비스 광고, Purity Coffee의 커피 광고를 포함함.
- 브리프는 프롬프트 없이 브랜드만 제공하는 방식부터 상세 지시와 정확한 문구를 지정하는 방식까지 다양하며, 정사각형 이미지와 4:5·9:16 스토리 형식, 텍스트가 없는 이미지, 전체 브랜드 키트 사용 조건도 포함함.
- 광고별 점수와 심사자 평가 세부 내용은 개별 결과에서 확인할 수 있음.
예쁜 이미지는 광고가 아님
- 일반적인 이미지 벤치마크가 미적 완성도를 평가하는 반면, Taste Bench는 광고를 다음 날 실제로 집행할 수 있는지를 평가함.
- 로고는 유사한 모양으로 대체하거나 다시 그리거나 색을 바꾸지 않고 정확히 반영해야 함.
- 제품은 AI가 추측해 만든 형태가 아니라 실제 판매되는 포장, 라벨, 모양과 일치해야 함.
- 제공된 문구는 철자까지 그대로 반영하고, 문구가 없을 때는 짧고 깔끔하게 작성해야 함.
- 아랍어는 오른쪽에서 왼쪽으로 읽히고, 힌디어는 데바나가리 문자로 표기되며, 일본어는 일본어로 유지되어야 함.
- 만들어낸 할인, 수치, 후기 등은 창의적 선택이 아니라 규정 준수 문제로 취급함.
- 로고와 문구, 제품은 Meta와 TikTok의 버튼이나 캡션에 가리지 않는 위치에 배치해야 함.
- 이 기준 가운데 하나라도 놓치면 광고가 아니라 위험 요소가 됨. Omneky는 이 항목을 자동으로 확인함.
모든 브리프에서 이기는 모델은 없음
- 상세 브리프를 잘 처리하는 모델이 정보가 거의 없는 브리프에서는 부진할 수 있으며, 영어 문구에 강한 모델이 아랍어에서도 가장 좋은 것은 아님.
- 시작 조건별 최고 모델은 다음과 같음.
- 프롬프트 없음: GPT Image 2.5 Flare, 광고 점수 7.5, 즉시 집행 가능 43%, 브리프 7개
- 간단한 아이디어: GPT Image 2, 7.7, 57%, 브리프 7개
- 붙여 넣은 프롬프트: GPT Image 2.5 Flare, 7.3, 29%, 브리프 7개
- 상세 브리프: GPT Image 2, 7.3, 29%, 브리프 7개
- 정확한 문구: GPT Image 2.5 Sunburst, 7.7, 57%, 브리프 7개
- 이미지 전용: GPT Image 2, 7.7, 43%, 브리프 7개
- 스토리·피드: GPT Image 2.5 Sunburst, 7.3, 43%, 브리프 14개
- 전체 브랜드 키트: GPT Image 2.5 Sunburst, 7.6, 33%, 브리프 3개
- 언어별 최고 모델은 일본어에서 GPT Image 2.5 Sunburst(7.6, 즉시 집행 가능 50%), 아랍어에서 GPT Image 2.5 Flare(7.5, 50%), 힌디어에서 GPT Image 2.5 Sunburst(7.7, 75%), 스페인어에서 GPT Image 2(7.6, 63%)임. 각 언어 평가에는 브리프 8개가 포함됨.
- 브리프마다 적합한 모델이 달라 Omneky는 모델 선택 메뉴를 제공하지 않고, 새 모델이 출시될 때마다 선택을 다시 검토함.
광고 심사 방식
- 블라인드 심사: 심사자는 어떤 모델이 이미지를 생성했는지 알 수 없으며, 이미지 이름을 바꾸고 모델을 식별할 수 있는 정보를 제거함.
- 세 개 연구소의 심사자: 서로 다른 세 연구소의 최첨단 AI 모델을 사용해 특정 모델이 자기 결과물을 평가하지 않도록 함.
- 품질 평가 전 검증: 먼저 통과·실패 기준을 적용한 다음, 품질을 1점(손상됨)부터 10점(에이전시 수준)까지 평가함.
- 다수결 기준: 모든 검사를 통과하고 심사자 다수가 그대로 집행할 광고라고 판단해야 즉시 집행 가능으로 분류함. 의견이 갈리면 실패로 처리함.
- 점수와 광고, 판정은 공개하지만 Omneky가 브랜드를 해석해 모델용 아트 디렉션으로 바꾸는 방식은 공개하지 않음. 모든 모델에 동일한 방식을 적용해 모델만 비교할 수 있도록 함.
- 새 이미지 모델이 출시되면 광고에 사용되기 전에 Taste Bench에서 평가하며, 페이지에는 항상 최신 버전을 표시함.
- 모델명과 로고는 각 소유자의 상표이며, 테스트 모델 식별 목적으로만 사용됨. 표시된 브랜드는 Omneky 테스트 세트에 포함된 브랜드임.
광고 제작 시작
- Omneky는 브랜드를 바탕으로 모델 선택, 아트 디렉션, 검토를 처리하고 광고 출시를 지원함.
- 이용 안내에는 7일 무료 체험 시작과 데모 예약이 포함됨.
댓글 (0)
로그인하면 이 기사에 내 생각을 남길 수 있어요