게시물이 있어요 > 정보공유

본문 바로가기
사이트 내 전체검색

정보공유

게시물이 있어요

페이지 정보

profile_image
작성자 길벗
댓글 0건 조회 407회 작성일 24-09-12 10:10

본문

페북에서 퍼온 글인데.. GPT로 개발할때 참고 하시면 좋을 거 같아서

사주 봐주는 챗봇 사주GPT 오픈한지 10개월 만에 "AI 사주" 검색 랭킹에서 구글, 네이버 모두 1위에 올랐습니다. 기존 운세 사이트들도 대부분 "AI 운세"를 내세우기 때문에 시간이 상당히 오래걸렸습니다. 비용 관계상 광고 집행등은 전혀하지 않았습니다.
현재 일 평균 5천명 정도 접속하는데 하루 500M 토큰 정도 처리 해야 합니다. gemma-2-9b에 레이어 몇개를 확장해서 10b로 쓰고 있습니다. A100 40G 4장으로 서비스 중인데 피크때는 빡빡 합니다. 유동적으로 기타 개발 장비도 투입하고 있습니다.
flashinfer를 사용하고 여러장비를 유동적으로 물릴수 있게 웹 단에서 밸런스 처리를 하고 있습니다. 일반 웹 밸런싱과 달리 llm은 한 트랜잭션 처리에 시간이 오래 걸리기 때문에 큐 관리가 까다롭습니다. A100 하나에 패러럴로 8개 요청 동시 처리 할 수 있고 속도는 참을 만 하게 나옵니다.
챗GPT 같은 서비스를 사용하느냐 직접 llm을 서빙하느냐 고민이 될 수 있는데 일정 사용자 이상이 되면 비용에서 차이가 많이 발생합다. 하루 500M 토큰이면 GPT4o 기준 500 * $5 = $2,500이 됩니다.(output 토큰은 $15 지만 대충 $5 계산) 5,000명 접속으로 이익은 고사하고 이정도 매출이라도 가능할까요? A100 40G 현재 가격은 $8,000 입니다.
기본적인 챗봇 생성 외에도 서비스가 고도화 되다 보면 한번의 사용자 요청에 llm을 여러번 호출해야 하는 경우가 반드시 발생합니다. 사주GPT의 경우도 실제로는 위에서 계산한 것 보다 3배 많은 토큰을 소비 합니다. 위 설정은 fp16 상황이고 8bit quantization 하면 동일 장비로 두배 이상 처리 가능합니다.

댓글목록

등록된 댓글이 없습니다.



회원로그인

회원가입

사이트 정보

커뮤니티명 : 지피티스퀘어(GPTsquare)
주소 : 서울시 구로구 디지털로33길 28, 우림이비지센터1차 406호
개인정보관리책임자 : 이현종
방장 이메일 : zagia@naver.com

접속자집계

오늘
639
어제
670
최대
2,458
전체
121,588
Copyright © GPTsquare.kr All rights reserved.