BTC ETH SOL XRP DOGE S&P 500 NASDAQ DOW EUR/USD USD/JPY GOLD
BTC ETH SOL XRP DOGE S&P 500 NASDAQ DOW EUR/USD USD/JPY GOLD

Read the English original

GitHub에서 간소화된 CUDA 학습

developer coding on a GPU terminal with code snippets displayed

커뮤니티가 큐레이션한 CUDA 리소스의 물결

해커 뉴스 사용자가 HN에 104 포인트와 21 개의 댓글로 게시 한 3 개의 새로운 저장소를 조명했습니다. 이 저장소는 CUDA 학습 자료, GPGPU 코드 샘플 및 PyTorch 레이어에 대한 새로운 접근 방식을 집계합니다. “awesome-cuda-books” 목록은 CUDA 개발자를위한 공개적으로 사용 가능한 책, 튜토리얼 및 치트 시트를 수집합니다. 동반자 인 “awesome-gpgpu”는 프로젝트가 여전히 활성 상태인지, 느려지고 있는지 또는 보관되었는지 색상으로 구분 된 범례를 추가합니다. 두 목록은 GitHub에 있으며 색인을 최신 상태로 유지하기 위해 기여자들을 초대합니다.

이러한 색인의 가치는 구체적인 범위에서 비롯됩니다. CUDA 책 모음은 PDF, 온라인 코스 및 코드가 포함 된 예제로 직접 연결되는 반면 GPGPU 목록은 CUDA, OpenCL 및 Vulkan에 리소스를 태그합니다. 활동 프로젝트 (녹색)에서 오래된 프로젝트 (빨간색)를 분리하여 엔지니어들이 쓸모없는 저장소를 파헤 치는 것을 피할 수 있습니다. 커뮤니티 중심 모델은 툴킷의 새 버전이 출시되면 색인이 몇 개월이 아닌 며칠 내에 새로 고쳐질 수 있음을 의미합니다.

Attorch는 Triton으로 손으로 쓴 커널을 대체하는 방법을 보여줍니다.

Show HN은 OpenAI의 Triton에서 실행되는 PyTorch의 nn 모듈의 순수 Python 재구현인 Attorch를 소개했습니다. 이 프로젝트는 torch==2.4.0triton==3.0.0이라는 두 가지 종속성만으로 제공되며 많은 표준 레이어에 대해 drop-in으로 대체 할 수 있다고 주장하면서도 개발자가 해킹 할 수있을만큼 가독성을 유지합니다. Attorch는 레이어에 대한 순방향 및 역방향 패스를 구현하므로 훈련 중에 사용할 수 있습니다.

디자인의 경우 원시 속도를 투명성으로 대체합니다. 컨볼루션 및 풀링 레이어는 Attorch의 자체 구현이 기본 커널에 비해 “극도로 느림”이기 때문에 PyTorch로 되돌아갑니다. 다른 모든 경우에 라이브러리는 PyTorch의 API를 미러링하며 각 모듈은 pytest 제품군에 포함 된 테스트를 통해 PyTorch 상대방과 테스트 할 수 있습니다. 코드베이스는 또한 메모리로드 / 저장 로직에서 순수 수학 커널을 분리하여 개발자가 저수준 CUDA를 작성하지 않고도 사용자 지정 작업을 실험 할 수있게하는 attorch.math 하위 모듈을 노출합니다.

실제로 Attorch는 커널 개발자를위한 샌드박스처럼 느껴집니다. 자동 혼합 정밀도 (AMP) 지원은 즉시 작동하며 Triton-autodiff 라이브러리는 순수 수학 기능에 대한 기울기를 자동으로 유도합니다. 절충안은 분명합니다. 느린 성능을 컴퓨팅 집중적 인 레이어에 사용할 수 있지만 자체 포함 및 단일 파일 디자인을 얻을 수 있습니다. 빠르게 프로토 타입을 생성해야하는 팀의 경우 속도가 느려질 수 있지만 프로덕션 워크로드의 경우 PyTorch로 다시 이동하는 것이 더 안전한 경로입니다.

WoolyAI의 런타임은 유휴 GPU 메모리를 사용 가능한 용량으로 전환합니다.

또 다른 Show HN 게시물은 WoolyAI의 CUDA 추상화 레이어를 발표했습니다. 이 런타임은 동적 공유 GPU 코어 및 VRAM을 경쟁 작업에 제공합니다. 이 도구는 코드 변경없이 기존 교육 및 추론 파이프 라인에 연결되어 “GPU 당 더 많은 작업”및 정책 인식 세분화 공유를 약속합니다. WoolyAI는 런타임을 정적 GPU 할당으로 인해 스트랜딩되는 용량을 재사용하는 방법으로 마케팅합니다.

배포 옵션에는 Kubernetes GPU Operator 및 Slurm 통합이 포함되어 클라우드 네이티브 및 HPC 환경 모두를 대상으로하는 프로젝트를 제안합니다. 런타임은 헤드룸을 측정하고 결과를보고하여 운영자가 실제 사용량 데이터를 기반으로 롤아웃을 계획 할 수있게합니다. 공유 로직을 응용 프로그램에서 추상화하여 WoolyAI는 엔지니어가 모델 개발에 집중할 수있게하고 플랫폼은 활용도가 낮은 하드웨어에서 추가 처리량을 짜냅니다.

WoolyAI가 코드를 변경하지 않고 활용도를 개선 할 수 있다고 주장하는 것은 대담합니다. 실제 클러스터에서 GPU 메모리 단편화 및 버스트 워크로드는 종종 VRAM의 30-40 %를 유휴 상태로 둡니다. WoolyAI가 유휴 슬라이스를 안전하게 멀티플렉스 할 수 있다면 비용 절감이 클 수 있습니다. 그러나 게시물에는 벤치 마크 번호가 제공되지 않으므로 실제 영향은 아직 확인되지 않았습니다.

무료 GPU 터미널 도구는 CUDA 신규 이민자의 진입 장벽을 낮 춥니 다.

세 번째 Show HN 항목은 Google Gemini에 요청을 프록시하는 명령 줄 도구를 소개하여 기본적으로 무료 GPU 액세스를 제공합니다. 프로젝트는 “터미널에서 무료 GPU”라고하며 로컬 서버를 실행하여 OpenAI 호환 API 호출을 Gemini 쿼리로 변환합니다. 사용자는 Gemini CLI를 설치 한 다음 cgpu serve로 서버를 시작해야합니다.

이 도구는 물리적 GPU가없는 개발자를 대상으로하지만 CUDA C ++을 실험하고 싶어합니다. 원격 서비스로 컴퓨팅을 라우팅하여 하드웨어 비용 장벽을 피할 수 있습니다. 저장소는 지속적인 개선을 약속하며, 기여자 들이 새로운 무료 컴퓨팅 소스를 제안하거나 버그를보고 할 수있는 공개 문제 탭이 있습니다. 이 접근 방식은 클라우드 기반 개발 환경의 광범위한 추세를 반영하지만 로컬로 유지되어 빠른 프로토 타이핑 또는 교실 환경에 매력적일 수 있습니다.

서비스는 외부 제공 업체 (Google Gemini)에 의존하지만 추상화 레이어 자체는 오픈 소스입니다. 즉, 커뮤니티는 서버를 분기하여 대체 백엔드로 지정하거나 지연을 줄이기 위해 캐싱 레이어를 추가 할 수 있습니다. 교육자의 경우 하드웨어 프로비저닝없이 샌드 박스 된 GPU 세션을 시작하는 기능은 CUDA 프로그래밍을 포함하는 커리큘럼을 가속화 할 수 있습니다.

GPU 개발이 모듈 식 공유 GPU 스택으로 이동하는 이유

모든 4 가지 프로젝트는 공통 주제를 공유합니다. GPU를 고정 된 리소스가 아닌 소프트웨어 계층에서 재구성 할 수있는 조합 가능한 빌딩 블록으로 취급합니다. 큐레이션 된 목록은 엔지니어에게 기존 지형의 지도를 제공하여 업데이트 된 튜토리얼을 찾는 시간을 줄여줍니다. Attorch는 Triton과 같은 새로운 컴파일 도구 위에 높은 수준의 프레임 워크를 재구성 할 수 있음을 보여 주며 사용자 정의 커널에 더 투명한 경로를 제공합니다. WoolyAI는 GPU 할당이 유동적 일 수 있음을 강조하여 유휴 코어를 생산적인 작업으로 전환합니다. 무료 GPU 터미널 프로젝트는 가장 비싼 하드웨어조차도 학습 목적으로 추상화 될 수 있음을 보여줍니다.

함께 이러한 노력은 GPU 개발이 하드웨어 공급 업체의 스택과 싸우는 것이 아니라 팀의 워크 플로에 맞는 모듈 식 조각을 함께 모으는 것에 더 집중하는 미래를 암시합니다. 각 프로젝트의 오픈 소스 특성은 개선 사항이 빠르게 전파 될 수 있음을 의미합니다. CUDA 책 색인의 버그 수정은 모든 신규 이민자에게 도움이 될 수 있습니다. Attorch의 수학 커널에서 성능 조정을 업스트림 할 수 있습니다. WoolyAI의 공유 정책은 새로운 스케줄러 통합으로 조정할 수 있습니다. 터미널 프록시는 다른 원격 제공 업체로 확장 할 수 있습니다.

주목해야 할 사항

앞으로 몇 개월 동안 이러한 도구가 초기 HN 버즈 이상으로 견인력을 얻는지를 확인할 것입니다. CUDA 책 색인 및 Attorch 저장소의 GitHub 스타 수를 주목하십시오. 빠른 성장은 커뮤니티의 지지를 나타낼 것입니다. WoolyAI의 경우 다중 테넌트 클러스터에서 사용률 이득을 정량화하는 벤치 마크 출시를 주목하십시오. 마지막으로 무료 GPU 터미널 프록시의 교육 프로그램 채택을 모니터링하십시오. 대학에서 CUDA 랩에 권장하기 시작하면 프로젝트는 차세대 GPU 엔지니어의 사실상의 진입 점이 될 수 있습니다.