Art Direct
Transformez le contenu en direction visuelle. Pointez ceci sur n'importe quoi — un deck, un document, un essai, un brief, une page web — et récupérez une direction créative que vous pouvez réellement exécuter.
Quand l'utiliser
- L'utilisateur partage un fichier (n'importe quel format) et a besoin de visuels pour celui-ci
- Développer une identité visuelle pour le contenu avant de construire/concevoir
- Traduire du matériel écrit en direction de photographie/illustration
- Créer des prompts d'image pour les outils de génération IA
- Art diriger une présentation, un document, un rapport ou un site web
- Examiner les visuels existants par rapport à l'intention du contenu (mode critique)
Entrées supportées
Lisez le contenu à partir de ce que l'utilisateur fournit :
| Format | Comment lire |
|---|---|
.txt, .md |
Outil Read directement |
.html |
Outil Read, supprimer les balises pour extraire texte + structure |
.pdf |
Outil Read avec paramètre pages |
.docx |
Extraire via python3 -c "import docx; ..." ou textutil -convert txt sur macOS |
.pptx |
Extraire via python3 -c "from pptx import Presentation; ..." |
.rtf |
textutil -convert txt sur macOS |
| URL | Outil WebFetch |
Si un format n'extrait pas correctement, demandez à l'utilisateur de coller le texte.
Le workflow
INGESTION CONTENU → ANALYSE → PROPOSER 2-3 DIRECTIONS → UTILISATEUR SÉLECTIONNE → BRIEF VISUEL + PROMPTS
Étape 1 : Ingestion et analyse du contenu
Lisez le contenu complet. Extrayez :
- Structure — Quelles sont les unités ? (slides, sections, chapitres, paragraphes, pages)
- Thèmes centraux — Les 2-3 grandes idées dont le contenu parle vraiment
- Arc narratif — Est-ce que ça se construit ? Contraste ? Se superpose ? Énumère ?
- Audience — Qui reçoit ceci ? Qu'attend-elle de voir ?
- Ton — Autoritaire ? Inspirant ? Intime ? Provocateur ? Technique ?
- Moments clés — Quelles sections portent le plus de poids, exigent les visuels les plus forts ?
- Langage visuel existant — Si le contenu a déjà des images, évaluez ce qui fonctionne et ce qui ne fonctionne pas
Produisez un bref résumé du contenu avant de continuer. Tenez-le serré — c'est pour l'alignement, pas un rapport complet.
Étape 2 : Propositions de direction créative
Si modèle de style maison fourni (--style <name>):
- Validez que le contenu s'adapte au style
- Notez les tensions et comment les surmonter
- Passez à l'Étape 3 avec le guide de style adapté
Si pas de style maison :
Proposez 2-3 directions visuelles distinctes. Chacune doit être véritablement différente — pas trois variantes de la même idée. Pour chacune :
DIRECTION : [Nom — une étiquette courte comme "Archival Authority" ou "Warm Machinery"]
AMBIANCE
Ce que ça ressent : [qualité émotionnelle en 2-3 mots]
Énergie : [calme / dynamique / tendue / contemplative / électrique]
STYLE PHOTOGRAPHIQUE
Type : [documentaire / éditorial / conceptuel / abstrait / d'archives / illustratif]
Sujets : [ce qui apparaît dans les images]
Éclairage : [qualité de la lumière]
Traitement de la couleur : [décalage chaud/froid, saturation, référence de stock film]
Composition : [approche du cadrage]
RÉFÉRENCES TOUCHSTONES
« Pensez [X] rencontre [Y] » — citez de vraies publications, campagnes, photographes ou marques
CE QUE CETTE DIRECTION ÉVITE
[Clichés visuels et tropes spécifiques que cette direction rejette]
POURQUOI CELA S'ADAPTE AU CONTENU
[1-2 phrases reliant la direction aux thèmes du contenu]
Présentez toutes les directions. L'utilisateur en choisit une (ou demande un hybride). Verrouillez le choix.
Étape 3 : Guide de style visuel
Une fois la direction sélectionnée, produisez le guide de style opérationnel :
GUIDE DE STYLE VISUEL : [Titre du contenu]
Direction : [Direction choisie]
STYLE PHOTOGRAPHIQUE
─────────────────────
Type : [Documentaire / Éditorial / Conceptuel / Abstrait / D'archives]
Sujets : [Ce à présenter — spécifique, pas générique]
Composition : [Règles de cadrage]
Éclairage : [Qualité de la lumière]
Traitement de la couleur : [Approche couleur, stock film si pertinent]
AMBIANCE ET TON
───────────────
Émotion primaire : [p. ex. confiance tranquille]
Émotions de soutien : [p. ex. chaleur, précision]
Niveau d'énergie : [Calme / Dynamique / Tendu / Contemplatif]
RÈGLES DE COHÉRENCE
────────────────────
• [Qualité partagée que tous les visuels doivent avoir]
• [Lignes directrices pour les sujets humains]
• [Ancres de palette de couleurs — codes hex]
• [Formats d'aspect par défaut]
LISTE NOIRE CLICHÉS
────────────────────
• [Images spécifiques au contenu à rejeter]
• [Tropes génériques à éviter]
• [Métaphores surutilisées pour ces thèmes]
VALEURS PAR DÉFAUT GÉNÉRATION IA
─────────────────────────────────
Suffixe photographie : [ajouts de prompt standard pour génération style photo]
Suffixe illustration : [ajouts de prompt standard pour génération style illustration]
Étape 4 : Exécution section par section
Travaillez à travers le contenu dans ses unités naturelles (slides, sections, chapitres, passages clés). Pour chacune :
Étape 1 : Interpréter le rôle de la section
Que doit communiquer le visuel ? Quel est le ton émotionnel ?
Étape 2 : Appliquer le cadre des cinq lentilles
Générez des options à travers cinq lentilles :
| Lentille | Ce qu'elle montre | Quand l'utiliser |
|---|---|---|
| Littérale | La chose elle-même, prise avec intention | Le contenu est déjà spécifique |
| Humaine | Les gens l'expérimentant ou le faisant | Besoin de connexion émotionnelle |
| Environnementale | Cadre, atmosphère, texture | Fixer l'ambiance, transitions |
| Métaphorique | Analogie visuelle concrète | Rendre l'abstrait tangible |
| Oblique | Angle abstrait, inattendu | Provoquer la réflexion, se démarquer |
Étape 3 : Produire le brief visuel
Pour la lentille recommandée (guidée par les préférences de lentille du guide de style), produisez :
SECTION : « [Titre de section ou ligne clé] »
TÂCHE VISUELLE : [Ce que cette image doit faire]
LENTILLE : [Quelle lentille et pourquoi]
CONCEPT
[Description 2-3 phrases de l'image exacte — assez spécifique pour qu'un
photographe puisse la prendre ou qu'un designer puisse la trouver]
PROMPTS GÉNÉRATION IA
─────────────────────
MIDJOURNEY :
[Prompt complet avec suffixes de style, flags --ar, --v, --style]
DALL-E / GPT IMAGE :
[Prompt en langage naturel optimisé pour DALL-E]
GEMINI :
[Prompt formaté pour génération d'image Gemini]
IDEOGRAM :
[Prompt formaté pour Ideogram, particulièrement pour besoins texte-dans-image]
GUIDANCE SOURÇAGE
─────────────────
Si recherche (pas génération) :
Recherche : [2-3 requêtes recherche spécifiques et raffinées]
Où : [Sources spécifiques — voir Guide des sources ci-dessous]
Éviter : [Ce qui sortira que vous devriez ignorer]
ALTERNATIVES
─────────────
[1-2 autres options de lentille brièvement décrites, au cas où la première ne convient pas]
Étape 4 : Pour le contenu avec nombreuses sections
Ne générez pas toutes les sections sans invitation. Produisez :
- Les 2-3 premières sections comme exemples
- Un tableau récapitulatif de toutes les sections restantes avec lentille recommandée et concept en une ligne
- Demandez quelles sections développer complètement
Le cadre des cinq lentilles (Détail)
Pour n'importe quel concept, cinq façons de le voir :
| Lentille | « Transformation numérique » | « Résilience de la chaîne d'approvisionnement » |
|---|---|---|
| Littérale | Corridor de salle serveur, LED clignotantes | Navire cargo traversant des mers agitées |
| Humaine | Visage du développeur éclairé par deux moniteurs à 2h | Mains du docker vérifiant le manifeste sous la pluie |
| Environnementale | Bureau vide à l'aube, un seul laptop brillant | Brume se levant sur le chantier de conteneurs à l'aube |
| Métaphorique | Ancien projecteur de film projetant la lumière sur mur blanc | Toile d'araignée tenant des gouttes de rosée — tension + beauté |
| Oblique | Main d'enfant dessinant un robot | Dominos figés à mi-chute, l'un brillant |
La lentille oblique est la plus difficile et la plus précieuse. C'est l'image qui fait quelqu'un arrêter et réfléchir. Utilisez-la pour les images principales et les sections d'ouverture.
Guide des sources
Ne defaultez pas sur les sites de photos stock. La recherche stock produit des résultats génériques peu importe la spécificité de vos termes. À la place :
Primaire : Génération IA
Le meilleur match pour une vision créative précise. Générez exactement ce que le concept décrit.
- Midjourney — Meilleur pour réalisme photographique et qualité cinématique
- DALL-E / GPT Image — Meilleur pour travail conceptuel et illustratif
- Gemini — Bon pour diagrammes, texte-dans-image, visualisation de données
- Ideogram — Meilleur quand l'image inclut du texte lisible ou de la typographie
Secondaire : Sources éditoriales et d'archives
Quand vous avez besoin de vraie photographie (historique, documentaire, journalistique) :
- Getty Editorial — Photojournalisme, archives historiques
- Magnum Photos — Photographie documentaire
- Library of Congress — Archives historiques US, domaine public
- NASA Image Gallery — Espace, science terrestre, technologie
- Wikimedia Commons — Domaine public, historique
- British Museum / Smithsonian — Objets historiques et documents
- Internet Archive — Documents historiques, publications, éphémères
- Google Arts & Culture — Collections muséales, œuvres d'art
Tertiaire : Stock curatisé (quand vous devez)
- Unsplash — Meilleur pour shots environnementaux/atmosphériques, pas de gens
- Pexels — Acceptable pour textures, arrière-plans, abstrait
- À éviter pour : Gens, scénarios commerciaux, technologie en utilisation, quoi que ce soit conceptuel
Pour besoins spécifiques
| Besoin | Meilleure source |
|---|---|
| Technologie historique | Smithsonian, Computer History Museum, Science Museum UK |
| Architecture | ArchDaily, photographie Dezeen |
| Scientifique | Imagerie Nature journal, NOAA, ESA/Hubble |
| Culturel | British Library, NYPL Digital Collections |
| Texture/matériel | Générer via IA — plus de contrôle |
Guide Anti-clichés
Liste noire universelle
Ces images sont invisibles — les viewers les ont vues des milliers de fois :
- Poignées de main (n'importe laquelle)
- Ampoule = idée
- Pièces de puzzle se connectant
- Personne au sommet de montagne
- Mains tenant le globe
- Équipe diverse pointant du doigt un whiteboard
- Plante qui germe = croissance
- Fusée = lancement/vitesse
- Échecs = stratégie
- Labyrinthe = complexité
- Route qui diverge en forêt = choix
- Iceberg = profondeur cachée
- Pont = connexion
La technique de reformulation
Quand vous vous surprenez à atteindre un cliché :
- Nommez le cliché — « Je suis sur le point de rechercher une ampoule »
- Demandez : Ce concept ressent quoi ? — Pas à quoi ça ressemble. À quoi ça ressent.
- Demandez : Quel moment capture ceci pour une vraie personne ? — La spécificité tue le cliché
- Générez cela à la place
Exemple : « Innovation »
- Cliché : Ampoule, circuit imprimé, fusée
- Ressent comme : Le moment avant de savoir si ça marche
- Moment réel : Main d'ingénieur plane sur un interrupteur, pas encore lancée
- C'est l'image
Mode critique
Quand pointé sur du contenu qui a déjà des images (deck existant, page web, document) :
Étape 1 : Ingestion et visualisation de tout
Lisez tout le contenu. Regardez chaque image. Faites le travail avant de parler.
Étape 2 : Résumé du langage visuel global
Commencez par une évaluation top-level du langage visuel dans la pièce entière. Couvrez :
- Dans quel registre sont les images ? (d'archives, éditorial, stock, mixte — nommez-le)
- Y a-t-il un langage visuel unifié ? Si non, combien de registres concurrents ?
- Quel est l'écart entre l'intention du contenu et l'exécution visuelle ? Le contenu essaie de dire X ; les images disent Y.
- Qu'est-ce qui fonctionne et qu'est-ce qui ne fonctionne pas — vue d'ensemble, pas image par image
Tenez ceci à un ou deux courts paragraphes directs. C'est le diagnostic principal.
Étape 3 : Résumé section par section
Pour chaque section/slide/chapitre, donnez un résumé haut niveau — pas un tableau image par image. Pour chaque section :
SECTION : [Titre ou ligne clé]
INTENTION CONTENU : [Ce que cette section essaie de communiquer]
EXÉCUTION VISUELLE : [Ce que les images font vraiment — 1-2 phrases]
VERDICT : [Fonctionne / Partiellement / Ne fonctionne pas — et pourquoi en une ligne]
IMAGE LA PLUS FORTE : [Laquelle et pourquoi, si pertinent]
IMAGE LA PLUS FAIBLE : [Laquelle et pourquoi — nommez le problème spécifique]
Allez image par image seulement si l'utilisateur vous demande de creuser une section spécifique.
Étape 4 : Recommandations
Terminez avec recommandations spécifiques et opinionnées — pas d'observations ouvertes. Le format :
DIRECTION RECOMMANDÉE
─────────────────────
Registre : [Le registre visuel spécifique que je recommande — p. ex. « archival-documentaire
avec traitement de couleur chaud » pas juste « choisir un registre »]
Pourquoi : [1-2 phrases reliant ceci aux thèmes réels et audience du contenu]
Référence : [Pensez X rencontre Y — citez des touchstones réels]
CE À CONSERVER
───────────────
• [Images spécifiques qui fonctionnent déjà, et pourquoi elles sont le standard]
CE À RETIRER IMMÉDIATEMENT
──────────────────────────
• [Images qui endommagent activement la pièce — stock, mauvaise marque, mauvais ton]
CE À REMPLACER
──────────────
• [Images faibles/génériques — avec concepts de remplacement en une ligne]
RÈGLE DE COHÉRENCE
────────────────────
[La qualité unifiante unique que tous les visuels devraient partager — énoncée comme règle
qui peut être appliquée comme test oui/non à n'importe quel visuel candidat]
Soyez spécifique. Soyez opinionnaire. Ne dites pas « engagez-vous pour un registre » — dites « Je recommande archival-documentaire avec traitement de couleur tungstène chaud, car ce contenu parle d'héritage et les images doivent ressembler à extraites d'une vraie archive d'entreprise. Pensez photographie Bell Labs rencontre chaleur matérielle Kinfolk. »
Ensuite demandez : « Cette direction vous semble-t-elle juste ? Si oui, je générerai des briefs de remplacement avec prompts IA pour chaque image qui doit changer. »
Étape 5 : Briefs de remplacement (après confirmation utilisateur)
Une fois que l'utilisateur confirme la direction recommandée, générez des briefs visuels de remplacement pour chaque image marquée pour suppression ou remplacement. Utilisez le format complet de l'Étape 4 section par section :
- Verrouillez la direction recommandée comme guide de style opérationnel
- Pour chaque image à remplacer, produisez le brief visuel complet avec :
- Concept (assez spécifique pour photographier ou générer)
- Prompts de génération IA (Midjourney, DALL-E, Gemini, Ideogram)
- Guidance sourçage (où trouver vraies alternatives si pas générer)
- Une option de lentille alternative
- Pour sections qui ont besoin d'images supplémentaires (actuellement trop peu), recommandez combien et fournissez des briefs
Format de sortie : Générez tous les briefs de remplacement à la fois, numérotés pour correspondre aux positions d'image originales. Exportez vers un fichier texte sur le Bureau de l'utilisateur pour référence facile et remise.
Étape 6 : Remise
Après génération des briefs de remplacement, offrez les prochaines étapes :
- « Générer maintenant » — Générez images via fal.ai (Flux 2 Pro) directement depuis les briefs
- « Exporter les briefs » — Enregistrez tous les prompts et guidance dans un fichier pour utilisation dans Midjourney/DALL-E/outils externes
- « Reconstruire le deck » — Alimentez le guide de style et images de remplacement dans keynote-slides-skill pour produire une version révisée
- « Enregistrer comme style maison » — Verrouillez la direction recommandée comme modèle YAML réutilisable pour travail futur avec cette marque
Génération d'image via fal.ai
Quand l'utilisateur sélectionne « Générer maintenant », générez les images en utilisant Flux 2 Pro via l'API fal.ai.
Exigences : La variable d'environnement $FAL_API_KEY doit être définie.
Comment générer
Pour chaque brief d'image, exécutez ceci via Bash :
curl -s "https://queue.fal.run/fal-ai/flux-pro/v1.1" \
-H "Authorization: Key $FAL_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"prompt": "<LE PROMPT DALL-E/FLUX DU BRIEF VISUEL>",
"image_size": "landscape_16_9",
"num_images": 1,
"safety_tolerance": "5"
}'
Ceci retourne une réponse JSON avec un request_id. Sondez pour le résultat :
curl -s "https://queue.fal.run/fal-ai/flux-pro/v1.1/requests/<REQUEST_ID>" \
-H "Authorization: Key $FAL_API_KEY"
Quand le statut est "COMPLETED", la réponse contient images[0].url. Téléchargez-la :
curl -sL "<IMAGE_URL>" -o "<OUTPUT_PATH>"
Workflow génération
- Créez un répertoire de sortie :
.art-direction/generated/(dans le projet) ou dossier Bureau - Pour chaque brief visuel, prenez le prompt DALL-E/GPT Image (ceux-ci fonctionnent mieux avec Flux)
- Soumettez à fal.ai, sondez pour achèvement, téléchargez le résultat
- Nommez fichiers par section :
section-01-heritage-grid.jpg,section-02-legacy-of-discovery.jpg, etc. - Après génération de toutes les images, affichez-les pour examen avec l'outil Read
- L'utilisateur peut approuver, demander régénération avec prompts ajustés, ou basculer vers une lentille différente
Options taille d'image
Valeur image_size |
Utiliser pour |
|---|---|
landscape_16_9 |
Slides présentation, images principales |
landscape_4_3 |
Slides standard, documents |
portrait_4_3 |
Mises en page verticales, mobile |
square |
Réseaux sociaux, vignettes |
square_hd |
Carré haute résolution |
Génération batch
Quand générant plusieurs images, soumettez toutes les requêtes en premier (ne pas attendre chacune), puis sondez pour les résultats. Ceci parallélise le travail GPU.
# Soumettez toutes les requêtes, collectez request IDs
for i in 1 2 3 4 5; do
curl -s "https://queue.fal.run/fal-ai/flux-pro/v1.1" \
-H "Authorization: Key $FAL_API_KEY" \
-H "Content-Type: application/json" \
-d "{\"prompt\": \"$PROMPT\", \"image_size\": \"landscape_16_9\"}" \
| python3 -c "import sys,json; print(json.load(sys.stdin)['request_id'])"
done
# Puis sondez chaque request_id pour résultats
Coût
Flux 2 Pro via fal.ai est pay-per-image. Le coût typique est ~$0,05-0,10 par image. Un remplacement deck complet (10-15 images) coûte environ $1-2.
Fallback
Si $FAL_API_KEY n'est pas défini ou l'API indisponible :
- Exportez les briefs vers fichier à la place
- Notez que l'utilisateur peut coller les prompts dans Midjourney, ChatGPT image gen, ou higgsfield.ai manuellement
Modèles de style maison
Directions visuelles réutilisables stockées dans ~/.agents/skills/art-direct/styles/ en YAML.
name: "Nom du style"
description: "Description une ligne avec références touchstones"
photography:
style: documentary | editorial | conceptual | abstract | archival
subjects:
preferred: [liste types sujets]
avoid: [liste types sujets à rejeter]
lighting:
preferred: [description qualité lumière]
avoid: [qualité lumière à rejeter]
composition: [règles cadrage]
color:
treatment: [approche couleur]
palette_anchors: [codes hex]
mood:
primary: [une qualité émotionnelle]
supporting: [liste émotions de soutien]
energy: [calm | dynamic | tense | contemplative]
lens_preferences:
default_order: [liste ordonnée des cinq lentilles]
weight_toward: [lentille primaire]
notes: "Guidance utilisation"
cliche_blacklist:
universal: [clichés standard]
brand_specific: [clichés spécifiques contexte]
ai_prompt_suffixes:
photography: "suffixe prompt pour génération style photo"
illustration: "suffixe prompt pour génération style illustration"
reference_touchstones:
- "Référence 1"
- "Référence 2"
Référence rapide
| Invocation | Objectif |
|---|---|
art-direct |
Workflow complet — ingestion contenu, proposer directions, générer briefs |
art-direct --style <name> |
Appliquer modèle style maison existant |
art-direct --critique |
Examiner visuels existants par rapport à intention contenu |
art-direct --section "concept" |
Brief visuel rapide section unique |
art-direct --from-frontend <project> |
Dériver style depuis projet frontend-design |
Intégration
Les sorties peuvent alimenter :
- keynote-slides-skill — Briefs visuels → imagerie slide via génération Gemini
- branded-pptx-converter — Briefs visuels → emplacements image PowerPoint
- frontend-design — Guide de style → langage visuel design web