TL;DR

  • SoftServe는 비볼록성과 대규모 매개변수라는 딥러닝의 장애물을 다루며, 선 탐색이나 임의의 곡률 보정 없이 확장 가능한 준뉴턴(QN) 최적화를 제공하는 방법군임.
  • Berglund et al. (2025)의 변분 목적함수에서 양의 정부호 곡률 추정치를 도출해 음의 곡률이 있는 경우에도 활용함.
  • 대각 및 크로네커 인수분해 변형을 제공하며, 구조상 양의 정부호성을 유지하고 대규모 신경망으로 확장됨.
  • 안정적인 결합 뉴턴-슐츠 반복법으로 비용이 큰 행렬 분해를 GPU 친화적인 행렬 곱셈으로 대체함.
  • 순환 신경망, 심층 오토인코더, 물리 정보 신경망, 1억 3,600만 매개변수 물리 정보 확산 모델 등 조건수가 매우 나쁜 문제에서 Adam, Muon, SOAP를 포함한 기존 기준선보다 낮은 손실을 달성하는 경우가 많음.

연구 배경과 방법

  • 준뉴턴(QN) 방법은 대규모 비제약 볼록 최적화에서 오랫동안 가장 효과적인 방법에 속했지만, 비볼록성과 막대한 매개변수 규모가 딥러닝 적용을 제한해 왔음.
  • SoftServe는 선 탐색이나 임의의 곡률 보정 없이 이 문제들을 해결하도록 설계된 준뉴턴 방법군임.
  • Berglund et al. (2025)의 변분 목적함수에서 곡률 추정치를 도출하며, 음의 곡률이 존재해도 양의 정부호 추정치를 확보함.
  • 대각 변형과 크로네커 인수분해 변형은 구조적으로 양의 정부호성을 보존하며 대규모 신경망에 확장 가능함.

행렬 연산과 확장성

  • 필요한 행렬 연산에는 안정적인 결합 뉴턴-슐츠 반복법을 사용함.
  • 비용이 큰 행렬 분해를 GPU에 적합한 행렬 곱셈으로 대체함.

평가 결과

  • 순환 신경망, 심층 오토인코더, 물리 정보 신경망, 1억 3,600만 매개변수 규모의 물리 정보 확산 모델을 포함해 조건수가 매우 나쁜 문제에서 성능을 보임.
  • Adam, Muon, SOAP 등 확립된 기준선보다 낮은 손실을 달성하는 경우가 많음.

논문 정보

  • 논문 제목: SoftServe: A Scalable Quasi-Newton Method for Deep Learning.
  • 저자: Joohwan Ko, Tetiana Parshakova, Diana Cai, Robert M. Gower.
  • arXiv 식별자: arXiv:2610.02182, 컴퓨터 과학 분야 머신러닝(cs.LG) 및 인공지능(cs.AI).
  • 제출일: 2026년 10월 1일.
  • DOI: https://doi.org/10.48550/arXiv.2610.02182