Reinforcement Learning Klimaoptimierung
Kurzdefinition
Reinforcement Learning (RL) ist ein maschinelles Lernverfahren, bei dem ein Software-Agent durch Trial-and-Error lernt, die optimale Klimastrategie für einen Grow-Room zu finden. Ziel: maximale Ernte bei minimiertem Energieverbrauch, ohne manuelle Regelwerke zu programmieren.
Wissenschaftliche Beschreibung
Grundprinzip
Klassische Klimasteuerung arbeitet mit festen Regelwerken: "Wenn Temperatur > 28 °C → Lüftung an". Reinforcement Learning ersetzt diese statischen Regeln durch einen Agenten, der durch Interaktion mit dem Gewächshaus lernt, langfristige kumulative Belohnung zu maximieren — ohne explizites Programmieren aller Szenarien.
Das Lernproblem wird als Markov Decision Process (MDP) formalisiert:
State Space (Zustandsraum) - Klimaparameter: Temperatur (T), relative Luftfeuchtigkeit (RH), CO₂-Konzentration, VPD (Vapour Pressure Deficit), PAR-Lichtintensität - Pflanzenparameter: Biomasse-Schätzung, Wachstumsstadium, Tagesverlauf - Externe Faktoren: Außentemperatur, Strompreis (für zeitvariable Optimierung)
Action Space (Aktionsraum) - Heizung / Kühlung (Stufenlos oder diskret) - Belüftungsrate (Einlass / Auslass) - CO₂-Dosierrate - Beschattungssysteme, Supplementbeleuchtung
Reward-Funktion
R = α × Pflanzenwachstum + β × Energieeffizienz − γ × Klimastress − δ × Sicherheitsverletzungen
Das Design der Reward-Funktion ist kritisch: Eine schlecht kalibrierte Funktion erzeugt Agenten, die Energie sparen, aber Ernteschäden riskieren.
Algorithmen
| Algorithmus | Typ | Stärken | Cannabis-Eignung |
|---|---|---|---|
| PPO (Proximal Policy Optimization) | On-policy, policy-gradient | Stabil, robuste Konvergenz | Gut für kontinuierliche Klimasteuerung |
| SAC (Soft Actor-Critic) | Off-policy, entropy-maximizing | Dateneffizient, Exploration | Gut bei komplexen Aktionsräumen |
| DQN (Deep Q-Network) | Off-policy, value-based | Einfach zu implementieren | Nur für diskrete Aktionsräume |
| DDAC | Distributional, off-policy | Robustheit unter Unsicherheit | Experimentell für Gewächshäuser |
Ergebnisse aus der Forschung
Ajagekar, Mattson & You (2023) kombinierten Deep RL mit robuster Optimierung für halb-geschlossene Gewächshäuser: signifikante Energieeinsparungen bei gleichzeitiger Einhaltung von Erntequalitatsbedingungen. Die robuste Optimierung im RL-Training-Loop adressiert Unsicherheiten in Wetterprognosen und Pflanzenreaktionen — kritisch für reales Deployment.
Ein 2024er Review in MDPI Sensors kategorisierte RL-Ansätze nach Algorithmusfamilien und Reward-Designs und identifizierte: Die meisten Studien bleiben in Simulation; echte Gewächshaus-Deployments sind selten, da explorative Aktionen Ernteschäden riskieren können.
Quantifizierte Ergebnisse (Literatur-Konsens): 25–30 % Energieeinsparung gegenüber regelbasierten Systemen in semi-geschlossenen Gewächshäusern.
Cannabis-spezifische Herausforderungen
Hoher Erntewert: Cannabis hat pro Anbaufläche deutlich höheren Wert als Tomaten oder Salat — zero tolerance für explorationsbedingte Qualitätseinbußen.
Lange Zyklen: 12–16 Wochen von Steckling bis Ernte. Reward-Signal extrem verzögert, was das Lernen verlangsamt (sparse reward problem).
Strain-Variabilität: Optimale Klimaparameter unterscheiden sich je nach Genetik; ein universeller RL-Agent müsste strain-spezifisch kalibriert werden.
Safety Constraints: Das Action Space wird auf bewährte Betriebsgrenzen geclipt (z.B. T 18–30 °C, RH 40–70 %), um katastrophale Explorationsschritte zu verhindern. Constrained RL und Safe RL sind aktive Forschungsgebiete.
Deployment-Strategie
- Simulation (Digital Twin): RL-Agent trainiert zunächst in einer virtuellen Kopie des Grow-Rooms — keine realen Pflanzen gefährdet
- Shadow Mode: Agent beobachtet realen Betrieb, generiert Empfehlungen ohne Eingriff → menschliche Validierung
- Supervised Transfer: Agent übernimmt schrittweise einzelne Klimaparameter unter Überwachung
- Autonomer Betrieb: Vollautonomie mit Safety-Monitoring und Kill-Switch
Anbau-Relevanz
RL-Klimasteuerung ist die fortgeschrittenste Form der Klimaoptimierung, bietet aber das höchste Umsetzungsrisiko. Der ROI ist erst nach 12–18 Monaten realisierbar.
Empfehlung: RL-Klimasteuerung erst pilotieren, nachdem IoT-Datenstack und Digital Twin aufgebaut sind. Simulation-Validierung ist Pflicht vor Live-Deployment. Energieeinsparungen von 25–30 % sind bei hohen Energiekosten der primäre Business Case.
Kommerzielle Ansätze: Freight Farms Greenery und RL Core Technologies (RTAO-Produkt) bieten erste kommerzielle RL-basierte Klimaoptimierung; cannabis-spezifische Implementierungen sind noch selten.
Verwandte Begriffe
- digital-twin — Simulationsumgebung für sicheres RL-Training
- iot-datenstack — liefert State-Space-Daten für den RL-Agenten
- anomalie-detektion-sensordaten — Sicherheitsnetz bei RL-Fehlverhalten
Quellen
- Ajagekar, A., Mattson, N.S. & You, F. (2023): Energy-efficient AI-Based Control of Semi-Closed Greenhouses with Deep Reinforcement Learning and Robust Optimization. Cell Reports Sustainability. https://www.sciencedirect.com/science/article/pii/S2666792422000373
- MDPI Sensors Review (2024): Enhancing Greenhouse Efficiency: Integrating IoT and Reinforcement Learning. Sensors 24(24):8109. https://www.mdpi.com/1424-8220/24/24/8109
- Kuijpers, W.J.P. et al. (2020): Deep Reinforcement Learning for Greenhouse Climate Control. ResearchGate. https://www.researchgate.net/publication/344859363
- van Beveren, P.J.M. et al. (2015): Optimal control of greenhouse climate. Acta Horticulturae 1154 (MPC-Vergleichsstudie)
Quellen
- https://doi.org/10.1021/acs
- Wang CT et al. (2022): Air quality in cannabis cultivation facilities. Environ. Sci. Technol. doi:10.1021/acs.est.1c06372