โ ๏ธ PERHATIAN
: Ini adalah model yang
belum melalui proses training
. Bobot model masih dalam kondisi
random initialization
. Output yang dihasilkan akan
tidak bermakna dan acak
.
Status Model:
๐ด
Belum dilatih
- Bobot masih random (Kaiming/Xavier init)
๐ก
Untuk riset & eksperimen
- Arsitektur sudah siap, tinggal train
๐ข
Production-ready architecture
- Teruji dan optimal
Widget di atas hanya menunjukkan
format input yang diharapkan
. Setelah model dilatih dengan dataset yang tepat, format yang sama akan menghasilkan output berkualitas tinggi.
๐ฏ Apa yang Bisa Dilakukan?
โ Bisa
โ Belum Bisa
Load model architecture
Generate teks bermakna
Test forward pass
Menjawab pertanyaan
Measure memory & speed
Reasoning & understanding
Start training
Production deployment
Fine-tuning experiments
Real-world applications
๐ Deskripsi
Caca
adalah arsitektur Large Language Model (LLM) generasi terbaru yang menggabungkan berbagai teknik state-of-the-art dalam deep learning. Model ini dirancang dengan fokus pada
efisiensi komputasi
,
skalabilitas
, dan
performa tinggi
.
๐ Tentang Project Caca
Caca
adalah eksperimen open-source Indonesian LLM yang dibuat dari nol secara individual dan bertahap. Bukan kompetitor siapa-siapa, cuma pengen eksplorasi apa yang bisa dilakukan dengan budget terbatas, passion unlimited, dan mindset collaborative.
Kalau berguna buat orang lain, alhamdulillah. Kalau enggak, ya tetap fun kok. Ini proyek eksplorasi, jadi kalau gagal ya bagian dari proses belajar. Kalau berhasil, itu bonus.
โ
Lyon
, Creator
๐ Mengapa Caca?
๐ฎ๐ฉ Fokus pada Bahasa Indonesia
- Dirancang dengan mempertimbangkan karakteristik bahasa Indonesia
โก Efisiensi Tinggi
- GQA & Flash Attention untuk inferensi 3-5x lebih cepat
๐พ Memory Efficient
- Hemat 50% memory untuk KV cache
๐ง Modular & Extensible
- Mudah dikustomisasi untuk berbagai use case
๐ Bilingual
- Support optimal untuk Indonesia & English
๐ฏ Keunggulan vs Model Lain
Fitur
Caca caca-65M
LLaMA-2 65.01M
GPT-3 65.01M
Attention Type
GQA
GQA
MHA
Position Encoding
RoPE + ALiBI
RoPE
Learned
Activation
SwiGLU
SwiGLU
GELU
Flash Attention
โ v2
โ v1/v2
โ
Long Context
Sliding Window + Sink
โ
Limited
MoE Support
โ Optional
โ
โ
Multimodal
โ Optional
โ
โ
Quantization
4/8-bit
4/8-bit
Limited
๐ฏ Use Cases & Applications
โ Cocok Untuk
๐ฌ Research & Development
Eksperimen arsitektur transformer
Ablation studies
Novel training techniques
Architecture search
๐ Academic & Education
Thesis & research papers
Teaching materials
Student projects
LLM internals understanding
๐ Base Model for Fine-tuning
Task-specific models
Domain adaptation
Instruction tuning
RLHF experiments
๐ก Prototyping
Proof of concept
Feature testing
A/B testing architectures
Benchmark comparisons
โ Tidak Cocok Untuk
๐ซ
Production Applications
- Model belum dilatih, output random
๐ซ
Real-world Deployment
- Perlu training & safety alignment dulu
๐ซ
Safety-critical Systems
- Tidak ada safety guardrails
๐ซ
Direct User-facing Apps
- Output tidak dapat diprediksi
๐ซ
Commercial Use (as-is)
- Harus dilatih terlebih dahulu
๐ Spesifikasi Model
Parameter
Value
Parameter
Value
Total Parameters
65,012,096
Vocab Size
16,000
Hidden Size
256
Intermediate Size
704
Num Layers
77
Attention Heads
4
KV Heads (GQA)
2
Head Dimension
64
Max Context Length
2,048
RoPE Base (ฮธ)
10,000
Model Size (FP16)
0.13 GB
Formatted Size
65.01M
๐ฏ Core Features
๐ Klik untuk expand/collapse
โ
Grouped Query Attention (GQA)
- Efisiensi memori dan komputasi superior
Query heads:
4
KV heads:
2
Ratio:
2:1
(hemat ~50% memory KV cache)
Benefit
: Inferensi lebih cepat dengan memory footprint lebih kecil
โ
Rotary Position Embeddings (RoPE)
- Generalisasi konteks panjang lebih baik
Theta (ฮธ):
10,000
Support extrapolation untuk konteks > training length
Benefit
: Performa stabil pada sequence length yang belum pernah dilihat saat training
โ
RMSNorm
- Normalisasi lebih stabil dan ~50% lebih cepat dari LayerNorm
Epsilon:
1e-06
Benefit
: Training lebih stabil, inference lebih cepat, gradient flow lebih baik
โ
SwiGLU Activation
- Performa 10-15% lebih baik dari ReLU/GELU
Intermediate size:
704
(2.8x hidden)
Benefit
: Kapasitas model lebih besar tanpa menambah parameter signifikan
โ
Flash Attention 2
- Akselerasi hingga 3x dengan memory efficiency
Otomatis aktif jika tersedia CUDA device
IO-aware algorithm untuk minimal HBM access
Benefit
: Training & inference jauh lebih cepat, support batch size lebih besar
๐ฅ Advanced Features
๐ฏ Mekanisme Attention
โก
Flash Attention v2
- Algoritma IO-aware yang 3x lebih cepat dari attention standar
from transformers import AutoConfig, AutoModelForCausalLM, AutoTokenizer
import torch
# Load configuration
config = AutoConfig.from_pretrained(
"Lyon28/caca-65M-untrained",
trust_remote_code=True
)
# Load model (FP16 untuk efisiensi)
model = AutoModelForCausalLM.from_pretrained(
"Lyon28/caca-65M-untrained",
config=config,
trust_remote_code=True,
torch_dtype=torch.float16,
device_map="auto"# Automatic device placement
)
# Model ini UNTRAINED - butuh training dulu!print(f"Model loaded: {model.num_parameters():,} parameters")
print("โ ๏ธ Model ini belum dilatih dan belum bisa digunakan untuk inference")
2๏ธโฃ Quantized Loading (4-bit/8-bit)
from transformers import AutoModelForCausalLM, BitsAndBytesConfig
import torch
# 4-bit quantization config
bnb_config = BitsAndBytesConfig(
load_in_4bit=True,
bnb_4bit_quant_type="nf4",
bnb_4bit_compute_dtype=torch.bfloat16,
bnb_4bit_use_double_quant=True
)
# Load model dengan quantization
model = AutoModelForCausalLM.from_pretrained(
"Lyon28/caca-65M-untrained",
trust_remote_code=True,
quantization_config=bnb_config,
device_map="auto"
)
print(f"Memory footprint: ~0.03GB (4-bit)")
from torch.optim import AdamW
from torch.cuda.amp import autocast, GradScaler
optimizer = AdamW(model.parameters(), lr=2e-4)
scaler = GradScaler()
for batch in dataloader:
# Mixed precision forwardwith autocast(dtype=torch.bfloat16):
outputs = model(**batch)
loss = outputs.loss
# Backward with gradient scaling
scaler.scale(loss).backward()
scaler.step(optimizer)
scaler.update()
optimizer.zero_grad()
Multi-GPU Training (DDP)
import torch.distributed as dist
from torch.nn.parallel import DistributedDataParallel
# Initialize process group
dist.init_process_group(backend="nccl")
# Wrap model
model = DistributedDataParallel(
model,
device_ids=[local_rank],
find_unused_parameters=False
)
Model mendukung format chat standar untuk conversational AI:
# Format chat template bawaan
chat_template = """{% for message in messages %}{% if message['role'] == 'system' %}System: {{ message['content'] }}{% elif message['role'] == 'user' %}User: {{ message['content'] }}{% elif message['role'] == 'assistant' %}Assistant: {{ message['content'] }}{% endif %}{% endfor %}{% if add_generation_prompt %}Assistant:{% endif %}"""# Contoh penggunaan
messages = [
{"role": "system", "content": "Kamu adalah asisten AI yang membantu dan ramah."},
{"role": "user", "content": "Jelaskan tentang fotosintesis"},
{"role": "assistant", "content": "Fotosintesis adalah proses di mana tumbuhan mengubah cahaya matahari menjadi energi kimia..."},
{"role": "user", "content": "Apa manfaatnya bagi manusia?"},
]
# Apply template
formatted = tokenizer.apply_chat_template(
messages,
tokenize=False,
add_generation_prompt=True
)
print(formatted)
# Output:# System: Kamu adalah asisten AI yang membantu dan ramah.## User: Jelaskan tentang fotosintesis# Assistant: Fotosintesis adalah proses di mana tumbuhan...# User: Apa manfaatnya bagi manusia?# Assistant:
๐ฏ Use Cases
Model ini dirancang untuk berbagai aplikasi NLP setelah melalui proses training:
Text Generation
โ๏ธ Creative writing & storytelling
๐ฐ Article generation
๐ฌ Conversational AI
๐ Text completion
Language Understanding
๐ Text classification
๐ท๏ธ Named Entity Recognition (NER)
โ Question Answering
๐ Summarization
Code Generation
๐ป Code completion
๐ Bug fixing suggestions
๐ Documentation generation
๐ Code translation
Multilingual Tasks
๐ Translation (ID โ EN)
๐ฃ๏ธ Cross-lingual understanding
๐ Multilingual classification
๐ Benchmark & Evaluation
โ ๏ธ Model belum melalui evaluasi karena status untrained
# Recommended untuk 65.01M model
learning_rate = 0.0005# Base LR
warmup_ratio = 0.05# 5% of total steps
lr_scheduler = "cosine"# atau "linear"# Learning rate scaling rule:# LR โ sqrt(batch_size)# Untuk batch size 256: LR = 0.0005# Untuk batch size 512: LR = 7.07e-04
Gradient Clipping
# Prevent gradient explosion
max_grad_norm = 1.0# Clip at 1.0# Monitor gradientsfrom torch.nn.utils import clip_grad_norm_
grad_norm = clip_grad_norm_(model.parameters(), max_grad_norm)
if grad_norm > 10.0:
print(f"โ ๏ธ High gradient norm: {grad_norm:.2f}")
Training Stability
# Tips untuk stable training:1. **Warmup**: Mulai dengan LR rendah
2. **Gradient Checkpointing**: Kurangi memory footprint
3. **Mixed Precision**: Gunakan BF16 jika tersedia (lebih stable dari FP16)
4. **Batch Size**: Start small, increase gradually
5. **Monitor**: Track loss, perplexity, gradient norms
๐ง Troubleshooting
Out of Memory (OOM)
# Solusi OOM saat training:
โ 1. Enable gradient checkpointing
model.gradient_checkpointing_enable()
โ 2. Reduce batch size
per_device_train_batch_size = 1
โ 3. Increase gradient accumulation
gradient_accumulation_steps = 32
โ 4. Use quantization
load_in_8bit = True# atau load_in_4bit
โ 5. Reduce sequence length
max_length = 2048# Start dengan ini
โ 6. CPU offloading (jika perlu)
device_map = "auto"
offload_folder = "offload"
Slow Training
# Optimasi kecepatan training:
โ 1. Flash Attention
config.use_flash_attn = True# 2-3x speedup
โ 2. Compile model (PyTorch 2.0+)
model = torch.compile(model, mode="reduce-overhead")
โ 3. DataLoader optimization
dataloader = DataLoader(
dataset,
batch_size=batch_size,
num_workers=4, # Parallel data loading
pin_memory=True, # Faster GPU transfer
prefetch_factor=2
)
โ 4. Mixed precision
use_fp16 = True# atau bf16
โ 5. Optimize communication (multi-GPU)
find_unused_parameters = False
gradient_as_bucket_view = True
NaN Loss
# Jika loss menjadi NaN:
โ 1. Reduce learning rate
learning_rate = learning_rate * 0.1
โ 2. Check gradient norms
clip_grad_norm_(model.parameters(), 1.0)
โ 3. Use BF16 instead of FP16
torch_dtype = torch.bfloat16 # Lebih stable
โ 4. Add epsilon to RMSNorm
rms_norm_eps = 1e-5# Increase jika perlu
โ 5. Check data
# Pastikan tidak ada inf/nan di datasetassertnot torch.isnan(input_ids).any()
assertnot torch.isinf(attention_mask).any()
Jika Anda menggunakan model ini dalam penelitian, mohon sitasi:
@misc{cacacaca65m,
author = {Lyon},
title = {Caca-caca-65M: Modern Transformer Architecture with Grouped Query Attention},
year = {2026},
publisher = {Hugging Face},
journal = {Hugging Face Model Hub},
howpublished = {\url{https://huggingface.co/Lyon28/caca-65M-untrained}},
note = {Untrained model with 65,012,096 parameters}
}
APA Style:
Lyon. (2026). Caca-caca-65M: Modern Transformer Architecture with Grouped
Query Attention [Untrained model]. Hugging Face.
https://huggingface.co/Lyon28/caca-65M-untrained
MLA Style:
Lyon. "Caca-caca-65M: Modern Transformer Architecture with Grouped Query Attention."
Hugging Face, 2026, huggingface.co/Lyon28/caca-65M-untrained.
๐ Acknowledgments
Model ini berdiri di pundak para raksasa! Terima kasih kepada:
Model ini adalah bagian dari
Caca Project
- Open source initiative untuk membangun Indonesian LLM ecosystem.
Created with ๐ป by
@Lyon28
|
Licensed under
Apache 2.0
|
Built with
๐ค HuggingFace
๐ "Dari nol, untuk semua" ๐
Last updated: january 2026
Built with โค๏ธ by Caca Transformers Team
Powered by ๐ค Transformers โข โก PyTorch โข ๐ฅ Flash Attention
Runs of Lyon28 caca-65M-untrained on huggingface.co
16
Total runs
0
24-hour runs
0
3-day runs
-4
7-day runs
5
30-day runs
More Information About caca-65M-untrained huggingface.co Model
caca-65M-untrained huggingface.co is an AI model on huggingface.co that provides caca-65M-untrained's model effect (), which can be used instantly with this Lyon28 caca-65M-untrained model. huggingface.co supports a free trial of the caca-65M-untrained model, and also provides paid use of the caca-65M-untrained. Support call caca-65M-untrained model through api, including Node.js, Python, http.
caca-65M-untrained huggingface.co is an online trial and call api platform, which integrates caca-65M-untrained's modeling effects, including api services, and provides a free online trial of caca-65M-untrained, you can try caca-65M-untrained online for free by clicking the link below.
Lyon28 caca-65M-untrained online free url in huggingface.co:
caca-65M-untrained is an open source model from GitHub that offers a free installation service, and any user can find caca-65M-untrained on GitHub to install. At the same time, huggingface.co provides the effect of caca-65M-untrained install, users can directly use caca-65M-untrained installed effect in huggingface.co for debugging and trial. It also supports api for free installation.