디시인사이드 갤러리

마이너 갤러리 이슈박스, 최근방문 갤러리

갤러리 본문 영역

[정보/뉴스] 최초의 프로덕션 규모 Mamba, Jamba 공개

ㅇㅇ(123.100) 2024.03.28 23:30:31
조회 1492 추천 34 댓글 12
														
  • a17d2cad2f1b782a99595a48fa9f3433f728bd6f6b8abd3f665cabf8d0
  • MoE + Mamba + Transformer 구현
  • 12B 활성 매개변수 및 총 52B 매개변수 (MoE)
  • 256K 컨텍스트 길이 지원
  • 단일 80GB GPU에 최대 140K 컨텍스트 토큰 수용 가능
  • 생성속도 트랜스포머 대비 3배 빠름
  • 일부는 Mamba 확장을 실험했지만 누구도 3B 매개변수 이상으로 확장하지 않았습니다. Jamba는 프로덕션급 규모에 도달한 최초의 하이브리드 아키텍처입니다.


MMLU 67.4%

HellaSwag 87.1% 등

(*LLaMa2 70B MMLU 69.8%)

7beb8073b2856ba23fe8d4e544d3276596908d2d733385241c1d52ade90209fae88b1dcc458f164b3d210a4d4a96fc002f2e7e3e8f3b45e9


Instruction finetuning이나 채팅폼에 맞게 미세조정, 정렬되지 않은 기본 모델인 점을 감안하면

꽤나 괜찮은 성적으로 보임


Mamba가 스케일 더 높였을 때도 잘 작동하나보네

메모리효율성 덕분에 컨텍스트 토큰도 엄청나게 많이 쓸 수 있는 것 같고


유망하다.



Jamba는 최첨단 하이브리드 SSM-Transformer LLM입니다. 이는 기존 Transformer 기반 모델에 비해 처리량 향상을 제공하는 동시에 가장 일반적인 벤치마크에서 해당 크기 등급의 주요 모델보다 성능이 뛰어나거나 일치합니다.


Jamba는 최초의 프로덕션 규모 Mamba 구현으로, 흥미로운 연구 및 적용 기회를 열어줍니다. 이 초기 실험에서는 고무적인 이점을 보여주지만 향후 최적화 및 탐색을 통해 이러한 이점이 더욱 향상될 것으로 기대합니다.


7fee9e36ebd518986abce8954180746dd7


자동등록방지

추천 비추천

34

고정닉 14

댓글 영역

전체 댓글 0
등록순정렬 기준선택
본문 보기

하단 갤러리 리스트 영역

왼쪽 컨텐츠 영역

갤러리 리스트 영역

갤러리 리스트
번호 말머리 제목 글쓴이 작성일 조회 추천
2863 설문 시세차익 부러워 부동산 보는 눈 배우고 싶은 스타는? 운영자 24/05/27 - -
453492 일반 역노화 실험 내년부터 시작한다는듯 [27] ㅇㅇ(112.168) 04.07 4507 39
453485 일반 전 테슬라 연구원"fsd 차기 버전은 인간과 소통할 수 있는 agi 버전 [14] ㅇㅇ(211.59) 04.07 1779 16
453484 일반 oai 연구원"영상 생성은 모든 것을 시뮬레이션 하여 agi로 이어질것" [28] ㅇㅇ(211.59) 04.07 3306 32
453475 정보/ "화산지대 암석 균열 속 열 흐름이 생명 기원 물질 생성 촉진" [3] ㅇㅇ(182.230) 04.07 1627 20
453458 일반 샘알트먼 & 사티나 나텔라 인터뷰 영상 [6] ㅇㅇ(211.107) 04.07 2159 29
453448 일반 싹다구속시켜.씨발.feel the agi.씹새끼들.꽉잡아라.노동시켜.노동 [34] 약중독고앵이갤로그로 이동합니다. 04.07 4334 93
453434 역노화 알츠하이머 치료제, 집에서 맞으며 관리하는 시대 열린다 [12] ㅇㅇ갤로그로 이동합니다. 04.07 1516 16
453431 일반 게임오바네 [13] ㅇㅇ갤로그로 이동합니다. 04.07 3816 60
453409 정보/ 알트먼, '챗GPT 전용 기기' 제조 위해 1.4조 모금 중 [15] ㅇㅇ(182.230) 04.06 2837 36
453377 일반 특이점으로 본 조1선붕당의 이해 [20] et갤로그로 이동합니다. 04.06 2380 63
453184 정보/ "빅뱅 10억년 후, 우주의 시간은 '5배' 느렸다" [13] ㅇㅇ(182.230) 04.06 3086 25
453181 정보/ 머스크 "AI 인재 전쟁은 미친 짓...테슬라 직원 급여 인상할 것" [5] ㅇㅇ(182.230) 04.06 919 12
453180 정보/ 람다, 'H100' GPU 담보로 6500억 대출 받아 [11] ㅇㅇ(182.230) 04.06 1890 23
453110 일반 아니 시발 이왜진? 작곡가들 쵸--비상!!!!!! [36] ㅇㅇ(222.118) 04.05 5568 44
452887 정보/ 염색체 말단 '텔로미어' 메커니즘 규명…"항암 치료 전략에 도움" [24] ㅇㅇ(182.230) 04.05 3526 23
452990 일반 인간 중위 데이터과학자를 능가하는 ai [17] 특술람갤로그로 이동합니다. 04.05 3529 28
452935 일반 "어이 샘! 오늘 트위터 근들갑 차례는 너라고!" [27] ㅇㅇ갤로그로 이동합니다. 04.05 3661 40
452927 일반 AI 일상화에 7100억원 투입···AI 혁명으로 한국 구조적 위기 극복 [32] Varian■Wrynn갤로그로 이동합니다. 04.05 3085 25
452894 정보/ SKT, OAI 미세조정 서비스 이용해 큰 효과 [10] ㅇㅇ(123.100) 04.05 1966 17
452889 정보/ 인간 뇌 모방한 '뉴로모픽 신경망', 컴퓨팅 난제 해결했다 [9] ㅇㅇ(182.230) 04.05 2138 22
452884 정보/ 욱한 마음 누르는 뇌 원리 찾았다…'감정 조절' 치료 가능할까 [10] ㅇㅇ(182.230) 04.05 2445 25
452876 정보/ Cohere, 강력한 오픈소스 LLM 공개(한국어 떡상) [8] ㅇㅇ(118.235) 04.05 2367 24
452868 정보/ KAIST, 소비 전력 15배 줄이는 뉴로모픽 반도체 메모리 소자 개발 [3] ㅇㅇ(182.230) 04.05 315 10
452855 일반 중력 너머 우주서…인류 구할 ‘신약 개발 상용화’ 첫발 [31] ㅇㅇ갤로그로 이동합니다. 04.05 2236 25
452754 일반 나 이상한게 보여.. [28] ㅇㅇ(1.244) 04.04 4769 31
452727 정보/ 오픈ai가 투자한 자율주행 개발 회사가 운영을 중단함 [22] ㅇㅇ(211.59) 04.04 3650 22
452596 일반 美 연구진 “챗GPT4, 임상 추론에서 의사보다 뛰어난 능력 보여” [61] ㅇㅇ(1.239) 04.04 3584 21
452509 정보/ 마소 기록상 가장 신뢰할 수 있는 논리적 큐비트를 시연 [17] ㅇㅇ갤로그로 이동합니다. 04.03 3425 23
452500 정보/ Stable Audio 2.0 발표 [20] ㅇㅇ(125.191) 04.03 3238 24
452470 정보/ 삼성전자, 오픈AI 진영 합류 결정… AI 반도체 ‘드림팀’ 꾸린다 [54] ㅇㅇ(211.59) 04.03 4568 45
452260 정보/ 로건GPT, 구글 제미니팀 입사 [5] ㅇㅇ(123.100) 04.03 2998 22
452246 정보/ Layer-Pruning & QLoRA를 활용한 모델 경량화 [3] ㅇㅇ(182.230) 04.03 1329 18
452199 정보/ 레딧 펌) 1.58비트 3진법 LLM 언어모델 오픈소스 공개 [12] ㅇㅇ갤로그로 이동합니다. 04.02 2660 19
452169 정보/ "2년 내 LLM 학습 데이터 고갈... AI 발전 중단될 것" [40] ㅇㅇ(182.230) 04.02 5019 28
452168 정보/ 구글, LLM 답변을 검색으로 확인하는 'SAFE' 개발 [7] ㅇㅇ(182.230) 04.02 1725 18
452167 정보/ 로봇 경찰견, 사람 대신 총 맞아..."인명 피해 방지" [23] ㅇㅇ(182.230) 04.02 2440 23
452163 정보/ 아마존, LLM '올림푸스' 올여름 출시... 매개변수는 예상 미만 [6] ㅇㅇ(182.230) 04.02 1392 17
452162 정보/ 오픈 소스 ‘미스트랄 7B v0.2’ 출시..."라마 2 능가" [3] ㅇㅇ(182.230) 04.02 1212 17
452155 정보/ 애플, 화면 맥락을 보고 이해할 수 있는 AI 개발 [8] ㅇㅇ(182.230) 04.02 2322 19
452114 일반 특갤이 openAI 지지하는 갤인 이유 [39] ㅇㅇ(175.206) 04.02 3159 45
452094 일반 ??? : ai 작곡으로 유행시킨거 하나라도 갖고와라 [28] ㅇㅇ(223.39) 04.02 4061 33
452024 정보/ 뇌를 모방한 AI 알고리즘을 찾아서, Hopfield 네트워크 [11] ㅇㅇ(182.230) 04.02 2004 23
452018 정보/ IBM의 최신 뉴로모픽 칩 NorthPole [7] ㅇㅇ(182.230) 04.02 1631 27
451975 정보/ MIT, LLM 속 지식 저장위치 찾아내는 방법 발견, 환각문제 개선가능 [18] 니지카엘갤로그로 이동합니다. 04.02 2281 23
451963 일반 근데 이미 본 떡밥이여도 굉장히 치명적인데? [4] ㅇㅇ(220.93) 04.02 1697 17
451923 토의 특이점을 위해서는 기술발전은 체감되지 못해야한다 [69] ㅇㅇ(1.230) 04.02 4337 66
451905 정보/ 기존 광섬유를 활용하여 450만배 빨라진 데이터 전송 성공 [38] 은바다갤로그로 이동합니다. 04.02 2996 22
451888 일반 작곡가 김형석 "suno 로 만든곡이 공모전 1위" ㄷㄷ [28] ㅇㅇ갤로그로 이동합니다. 04.02 3508 28
451881 일반 진짜 특갤 정보차이 너무 심한데 [25] ㅇㅇ갤로그로 이동합니다. 04.02 3853 32
451845 일반 정전갤된 김에 알트만의 포지션(?)을 알아보자 [34] ㅇㅇ(1.230) 04.01 2595 25
갤러리 내부 검색
제목+내용게시물 정렬 옵션

오른쪽 컨텐츠 영역

실시간 베스트

1/8

뉴스

디시미디어

디시이슈

1/2