Salut les Patreons, j'espère que vous allez bien !
Alors je vous dois toujours un article sur le RAG que j'ai monté, mais vous me connaissez, je me fais distraire avec un rien.
Et donc c'est pourquoi aujourd'hui je vous montre comment configurer Claude Code pour le faire fonctionner avec un modèle gratuit.
Vous allez voir, c'est vraiment pas compliqué, ça va pas vous prendre longtemps et ça vous permettra de faire quand même pas mal de trucs sans débourser un centime et sans rien envoyer sur les serveurs des méchants américains ^^.
Encore merci pour votre soutien et à très bientôt.
Korben
et en bonus je vous l'ai fait en version écrite aussi :
=================================
Vous en avez marre de payer votre abonnement Claude pour coder ? Ou alors vous bossez sur des projets confidentiels et l'idée d'envoyer votre code sur les serveurs d'Anthropic vous file des boutons ? J'ai une bonne nouvelle pour vous !
Depuis la version 0.14 d'Ollama, il est possible de faire tourner Claude Code avec des modèles open-source en local. Et le plus dingue, c'est que c'est hyper simple à mettre en place. Du coup, je vous montre comment brancher tout ça avec GLM-4.7, le modèle chinois qui cartonne en ce moment sur les benchmarks de code.
Ce qu'il vous faut
Avant de se lancer, petit check des prérequis :
Ollama 0.14+ (la version qui supporte l'API Anthropic)
16 Go de RAM minimum (32 Go c'est mieux)
Un GPU avec 24 Go de VRAM pour du confort, sinon ça tourne en CPU mais c'est plus lent
Node.js 18+ pour installer l'agent de codage
Côté GPU, une RTX 3090 ou 4090 fait très bien le taf. Sur Mac avec Apple Silicon, 16 Go de mémoire unifiée ça passe avec la quantization 4-bit.
Étape 1 - Installer Ollama
Si c'est pas déjà fait, hop on installe Ollama :
curl -fsSL https://ollama.com/install.sh | sh
Sur Mac, vous pouvez aussi passer par Homebrew avec brew install ollama.
Étape 2 - Télécharger GLM-4.7
GLM-4.7-Flash c'est le petit nouveau de Z.ai qui défonce tout sur les benchmarks de code. Y'a plusieurs versions selon votre config :
# Version standard (19 Go, quantization Q4) ollama pull glm-4.7-flash # Version plus précise si vous avez la VRAM (32 Go) ollama pull glm-4.7-flash:q8_0
Le modèle supporte 128K tokens de contexte, ce qui est largement suffisant pour analyser des projets entiers.
Étape 3 - Installer Claude Code
L'installation de l'outil d'Anthropic se fait en une commande :
curl -fsSL https://claude.ai/install.sh | bash
Sur Mac, y'a aussi Homebrew : brew install --cask claude-code.
Étape 4 - La méthode facile avec ollama launch
Et là c'est magique. Ollama a ajouté une commande qui configure tout automatiquement :
ollama launch claude
Hop, ça lance l'agent avec votre modèle local. Pas de variables d'environnement à configurer, pas de fichiers JSON à tripatouiller. Vous choisissez le modèle dans la liste et c'est parti.
Étape 4 bis - Configuration manuelle
Si vous voulez plus de contrôle, vous pouvez configurer les variables d'environnement à la main :
export ANTHROPIC_AUTH_TOKEN=ollama
export ANTHROPIC_BASE_URL=http://localhost:11434
export ANTHROPIC_API_KEY=""
Puis lancez avec le modèle de votre choix :
claude --model glm-4.7-flash
Et LM Studio alors ?
Pour ceux qui préfèrent LM Studio à Ollama, c'est un poil plus compliqué. LM Studio utilise l'API OpenAI, pas l'API Anthropic. Du coup il faut un proxy comme LiteLLM pour faire la traduction.
En gros, LiteLLM se place entre l'agent et LM Studio pour convertir les requêtes. Ça marche, mais c'est une dépendance de plus. Perso je reste sur Ollama, c'est plus direct.
Dépannage
Si ça coince, quelques trucs à vérifier :
Ollama tourne bien ? Testez avec ollama list
Le modèle est téléchargé ? ollama pull glm-4.7-flash
Votre contexte est suffisant ? Vérifiez avec /status dans Claude Code
Performances à attendre
Sur une RTX 4090 en quantization 4-bit, comptez 60-80 tokens par seconde. C'est pas aussi rapide que l'API cloud, mais c'est gratuit et vos données restent chez vous.
Bref, si vous voulez coder avec une IA sans vous ruiner ni exposer vos projets, cette config fait le taf. Amusez-vous bien !