전체 글 썸네일형 리스트형 ComKD-CLIP: Comprehensive Knowledge Distillation for Contrastive Language-Image Pre-traning Model 리뷰 출처: ComKD-CLIP: Comprehensive Knowledge Distillation for ContrastiveLanguage-Image Pre-traning Mode (본 논문에는 pre-traning(=pre-training), pipline(=pipeline) 등 오타로 보이는 부분들이 존재하지만, 본 리뷰에서는 고증을 위해 이를 그대로 표기합니다. 혼란스러워하지 마시고 일반적인 의미로 읽어주시면 감사하겠습니다.)AbstractCLIP (Contrastive Language-Image Pre-training)대규모 → 자원이 제한된 환경에서 배포하기 어려움소규모 → 실제 응용에 요구되는 성능 기준을 만족하지 못하는 경우 多ComKD-CLIPteacher(대규모) & student(소규모).. 더보기 Chain-of-Thought Prompting Elicits Reasoning in Large Language Models 리뷰 출처: Chain-of-Thought Prompting Elicits Reasoning in Large Language ModelsAbstract충분히 큰 언어 모델Chain-of-Thought Prompting산술 추론(arithmetic reasoning), 상식 추론(commonsense reasoning), 기호 추론(symbolic reasoning)단 8개의 예시만으로, PaLM 540B는 GSM8K 수학 문제 벤치마크에서 SOTAIntroduction최근 동향 및 문제 제기:언어 모델의 규모를 확장하면 성능 향상, 샘플 효율성 증가 등의 효과가 있지만,산술 추론, 상식 추론, 기호 추론과 같은 어려운 과제에서는 높은 성능을 달성하기 충분하지 않다기존 연구들:자연어 기반 근거 생성(natura.. 더보기 DeepSeek-V3 Technical Report 리뷰 출처: DeepSeek-V3 Technical ReportAbstractDeepSeek-V3는 어떤 모델?Mixture-of-Experts(MoE) 언어 모델크기: 총 6710억 개의 파라미터 (각 토큰에 대해 370억 개의 파라미터 활성화)학습 목표: multi-token prediction (MTP)DeepSeek-V2에서 가져온 것Multi-head Latent Attention (MLA)DeepSeekMoE 아키텍처차이점auxiliary-loss-free strategy왜?for load balancing학습14조 8천억 개의 다양하고 고품질 토큰으로 사전학습Supervised Fine-Tuning & Reinforcement Learning소요 시간: 278만 8천 시간의 H800 GPU 시간전.. 더보기 이전 1 다음