Kursplan
1. Introduksjon til dyp reforcelæring
- Hva er reforcelæring?
- Forskjellen mellom overvakt, undervakt og reforcelæring
- Anvendelser av DRL i 2025 (robotikk, helsevesen, finans, logistikk)
- Forståelse av agent-omgivelsesinteraksjonssyklusen
2. Grunnleggende i reforcelæring
- Markov-besluttningsprosesser (MDP)
- Tilstand, handling, belønning, politikk og verdifunksjoner
- Kompromiss mellom utforskning og utnyttelse
- Monte Carlo-metoder og Temporal-Difference (TD) læring
3. Implementering av basis-RL-algoritmer
- Tabular metoder: Dynamisk programmering, politikkvurdering og iterasjon
- Q-Learning og SARSA
- Epsilon-greedy utforskning og avtagende strategier
- Implementering av RL-omgivelser med OpenAI Gymnasium
4. Overgang til dyp reforcelæring
- Begrensninger i tabular metoder
- Bruk av neurale nettverk for funksjonsapproximasjon
- Arkitektur og arbeidsflyt for Deep Q-Network (DQN)
- Opplevelsesspill og målnettverk
5. Avanserte DRL-algoritmer
- Double DQN, Dueling DQN og prioriteret opplevelsesspill
- Politikkgradient-metoder: REINFORCE-algoritmen
- Actor-Critic-arkitekturer (A2C, A3C)
- Proximal Policy Optimization (PPO)
- Soft Actor-Critic (SAC)
6. Arbeid med kontinuerlige handlingsrom
- Utfordringer i kontinuerlig styring
- Bruk av DDPG (Deep Deterministic Policy Gradient)
- Twin Delayed DDPG (TD3)
7. Praktiske verktøy og rammeverk
- Bruk av Stable-Baselines3 og Ray RLlib
- Logging og overvåking med TensorBoard
- Hyperparameterjustering for DRL-modeller
8. Belønningsingeniør og miljødesign
- Belønningsforming og balanse av gebyrer
- Konsepter for overføring fra simulering til virkelighet
- Oppretting av tilpassede omgivelser i Gymnasium
9. Delvis observerbare omgivelser og generalisering
- Håndtering av ufullstendig tilstandsinformasjon (POMDPs)
- Minnebaserte tilnærminger ved hjelp av LSTMs og RNNs
- Forbedring av agentens robusthet og generalisering
10. Spillteori og fleragentbasert reforcelæring
- Introduksjon til fleragentomgivelser
- Samarbeid vs. konkurranse
- Anvendelser i motstandstrening og strategiøkonomisering
11. Tilfellsstudier og reelle anvendelser
- Simuleringer av selvgående kjøring
- Dynamisk prisfastsettelse og finansielle handelsstrategier
- Robotikk og industriell automatisering
12. Feilsøking og optimalisering
- Diagnostisering av ustabil trening
- Håndtering av belønningsfattigdom og overfitting
- Skaling av DRL-modeller på GPU-er og distribuerte systemer
13. Oppsummering og neste steg
- Resumè av DRL-arkitektur og sentrale algoritmer
- Bransjetrend og forskningsretninger (f.eks. RLHF, hybride modeller)
- Ytterligere ressurser og lesestoff
Krav
- Fagkyndighet i Python-programmering
- Forståelse av kalkulus og lineær algebra
- Grunnleggende kunnskap om sannsynlighets- og statistikkteori
- Erfaring med å bygge maskinlæringsmodeller ved hjelp av Python og NumPy eller TensorFlow/PyTorch
Målgruppe
- Utviklere som er interessert i KI og intelligente systemer
- Datavitenskapsfolk som utforsker rammeverk for reforcelæring
- Maskinlæringsingeniører som jobber med autonome systemer
Referanser (3)
Jeg likte virkelig avslutningen hvor vi tok tiden til å leke med CHAT GPT. Rommet var ikke satt opp på den beste måten for dette - istedenfor én stor bord ville det vært lurt med noen mindre bord slik at vi kunne dele oss inn i små grupper og brainstorme.
Nola - Laramie County Community College
Kurs - Artificial Intelligence (AI) Overview
Maskinoversatt
Å jobbe ut fra grunnleggende prinsipper på en konsernet måte, og gå over til å anvende kasusstudier samme dag
Maggie Webb - Department of Jobs, Regions, and Precincts
Kurs - Artificial Neural Networks, Machine Learning, Deep Thinking
Maskinoversatt
At det brukt reelle selskapsdata. Instruktøren hadde en veldig god tilnærming ved å få deltakerne til å delta og konkurrere
Jimena Esquivel - Zaklad Uslugowy Hakoman Andrzej Cybulski
Kurs - Applied AI from Scratch in Python
Maskinoversatt