facebook pixel
Selamlar Dostlar, tüm gece 6xH200 ile ~800 Vram kullanarak Mistral Large 3 QLoRa finetune üzerinde ve Mac Studio M3 Ultra 512GB + Nvidia DGX Spark ile exolab cluster üzerinde çalıştım. 06.12.25 Çalışma Notlarım; 1) 6xH200 ile Mistral Large 3 üzerinde finetuning için çalışmalara başladım. Bu yeni Mistral modeli çıktığında beni fazla heyecanlandırmasada finetune ederek üzerinde çalışmak ve sınırlarını test etmek istedim. 🦾 Finetuning için zorlayıcı bir yapısı yok gibi, son Deepseek v3.2’den ayrıldığı yönler ise; Uzun cevaplı, agentik, CoT’lu workload’larda Mistral’in çıktısı özellikle çok pahalı. Mistral’in 256K context’i güzel, ama attention hala O(L^2). DeepSeek V3.2 DSA ile O(L·k) ve raporlara göre 128K’de %70’e varan cost düşüşü gösteriyor. 100K’dan fazla token senaryolarda, aynı task için Mistral’i çalıştırmak hem daha yavaş hem de daha pahalı oluyor. DeepSeek-V3.2 agent, agent-coding ve agent-search için ayrı yetkinlikleri ve RL pipeline’ı var. Mistral Large 3’de function call...
    Suggested Credits
    Tags, Events, and Projects