Below is the list of all the posters for each poster session.
Monday, Poster A --- 11:00 - 12:30
- Reinforcement Learning with Abstention: Interaction-Aware Regret Bounds by Yuan Cheng, Vincent Y. F. Tan
- SUN: Reaching for Novelty in Reinforcement Learning by Wenyan Yang, Arsenii Mustafin, Dominik Baumann, Joni Pajarinen, Simone Parisi
- The Horizon Threshold in Cooperative Multi-Agent Reward-Free Exploration by Idan Barnea, Orin Levy, Yishay Mansour
- Split the Differences, Pool the Rest: Provably Efficient Multi-Objective Imitation by Ziyad Sheebaelhamd, Luca Viano, Volkan Cevher, Claire Vernade
- Provably avoiding over-optimization in DPO without knowing the data distribution by Adam Barla, Emanuele Nevali, Luca Viano, Volkan Cevher
- Soft-SVeRL: Self-Verified Reinforcement Learning with Soft Rewards by Pierre Clavier
- Efficient Heteroscedastic Bayesian Optimization for Risk-Aware AutoRL by Mingxuan Che, Tsung Yuan Tseng, Theresa Eimer, Marius Lindauer, Alexander von Rohr
- Collaborating in Multi-Armed Bandits with Strategic Agents by Idan Barnea, Ofir Schlisselberg, Yishay Mansour
- EVaR-optimal arm identification in bandits models by Mehrasa Ahmadipour, Aurélien Garivier
- Discovery of Sticky and Responsible Markov Options for Frozen-Option Transfer by Yamen Habib, Dmytro Grytskyy, Rubén Moreno-Bote
- Combining Constrained Sampling and Reinforcement Learning for Manipulation by Marc Toussaint, Cornelius V. Braun, Armand Jordana, Sayantan Auddy, Eckart Cobo-Briesewitz, Denis Shcherba, Tilman Burghoff, Justin Carpentier
- Multi-Timescale Successor Alignment for Decoder-Free World Models by Zeqiang Zhang, Fabian Wurzberger, Daniel Alexander Braun
- (Semi-)Adversarial Causal Bandits with Known Causal Mechanisms by Hubert Marek Drazkowski, Yevgeny Seldin
- CRAX: Fast Safe Reinforcement Learning Benchmarking by Tristan Tomilin, Mourad Boustani, Mickey Beurskens, Thiago D. Simão
- CORL: Reinforcement Learning of MILP Policies Solved via Branch‐and‐Bound by Akhil S Anand, Elias Aarekol, Martin Dalseg, Magnus Stålhane, Sebastien Gros
- Reinforcement Learning with Multi-Step Lookahead Information Via Adaptive Batching by Nadav Merlis
- Use the Online Network If You Can: Towards Fast and Stable Reinforcement Learning by Ahmed Hendawy, Henrik Metternich, Théo Vincent, Mahdi Kallel, Jan Peters, Carlo D'Eramo
- Swarm Counter-Swarm using Multi-Objective Multi-Agent Reinforcement Learning by Kévin Constantin, Florian Felten, Grégoire Danoy, Changey, Guillaume STRUB
- Minimax PAC Bounds for Learning in Exogenous Contextual MDPs by Corentin Pla, Hugo Richard, Marc Abeille, Vianney Perchet
- Factoriax - A GPU-Accelerated Factory Building Simulator In The Style Of Factorio by Mickey Beurskens, Tristan Tomilin, Thiago D. Simão
- Tight Sample Complexity Bounds for Entropic Best Policy Identification by Amer Essakine, Claire Vernade
- Twice-Sequential Monte Carlo for Tree Search by Yaniv Oren, Joery A. de Vries, Pascal R. Van der Vaart, Matthijs T. J. Spaan, Wendelin Boehmer
- Robustness Is Free ? Global Convergence of Robust Policy Gradient Without Smoothing by Navdeep Kumar, Kfir Yehuda Levy, Shie Mannor
- Extending Graph-Based Skill Discovery to Continuous State MDPs by Harvey Ayling, Özgür Şimşek, Joshua Benjamin Evans
- Improved regret bounds in tabular RL under local differential privacy by Hugo Richard
- URB - Urban Routing Benchmark for RL-equipped Connected Autonomous Vehicles by Ahmet Onur Akman, Anastasia Psarou, Michał Hoffmann, Łukasz Gorczyca, Lukasz Kowalski, Paweł Gora, Grzegorz Jamróz, Rafal Kucharski
- Complexity Estimation for Q-Functions in Reinforcement Learning by Nigel De Meulder, Ali Anwar, Siegfried Mercelis
- State Representation Matters in Deep Reinforcement Learning: Application to Energy Trading by Jesper Klicks, Sander Vrzina, Vincent Francois-Lavet
- COMRAD: A Benchmark for Embodied Multi-Agent Reinforcement Learning by Khoi H.B. Nguyen, Dimitar Zhivkov Zhekov, Tristan Tomilin
- On Natural Policy Compression by Leonardo Cesani, Davide Tenedini, Matteo Papini, Marcello Restelli
Monday, Poster B --- 16:00 - 18:00
- Beyond Softmax and Entropy: Convergence Rates of Policy Gradients with f -SoftArgmax Parameterization & Coupled Regularization by Safwan Labbi, Daniil Tiapkin, Paul Mangold, Eric Moulines
- When (and How) to Trust the Expert: Diagnosing Query-Time Expert-Guided Reinforcement Learning by Yann Berthelot, Philippe Preux, Riad Akrour
- Dyna-Style Safety Augmented Reinforcement Learning: Staying Safe in the Face of Uncertainty by Artur Eisele, Bernd Frauenknecht, Friedrich Solowjow, Sebastian Trimpe
- Analyzing Value-Based Reinforcement Learning through the Lens of Mode Connectivity by Ahmed Hendawy, Henrik Metternich, Jan Peters, Carlo D'Eramo
- Distributional value gradients for stochastic environments by Baptiste Debes, Tinne Tuytelaars
- Bi-Level Reinforcement Learning Pathway for Sim-to-Real Optimality by Akhil S Anand, Shambhuraj Sawant, Paavo Parmas, Jasper Hoffmann, Dirk Reinhardt, Sebastien Gros
- Reinforcement Learning with Complex (valued) Memories by Sathya Kamesh Bhethanabhotla, Stratis Gavves, André Biedenkapp
- Pure Exploration with Infinite Answers by Riccardo Poiani, Martino Bernasconi, Andrea Celli
- Hadamard Representation: Scaffolding Performance Across Model-free RL by Jacob Eeuwe Kooi, Zhao Yang, Mark Hoogendoorn, Vincent Francois-Lavet
- Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access by Daniel Ebi, Damien Ernst, Klemens Böhm, Gaspard Lambrechts
- Learning Rewards in Strategic Games by Antoine Bergerault, Cyrille Kone, Giorgia Ramponi
- Leveraging Similarities in Multi-Armed Bandits by Khaled Eldowa, Thibaud Rahier, Augustin Cablant, Panayotis Mertikopoulos, Pierre Gaillard
- Sparse Masked Attention Policies for Reliable Generalization by Caroline Horsch, Laurens Engwegen, Max Weltevrede, Matthijs T. J. Spaan, Wendelin Boehmer
- Streaming Reinforcement Learning under Partial Observability with Real-Time Recurrent Learning by Noah Farr, Aryaman Reddi, Jan Peters, Carlo D'Eramo
- Rationality Randomization with Maximum Entropy for Robust Dynamic Obstacle Avoidance on Legged Robots by Jose-Luis Holgado-Alvarez, Gabriele Tiboni, Aryaman Reddi, Carlo D'Eramo
- JAXtari: High-Throughput and Easy-to-Modify Arcade Learning Environment by Quentin Delfosse, Raban Emunds, Paul Seitz, Sebastian Wette, Jannis Blüml, Daniel Kirn, Dominik Mandok, Kristian Kersting
- Inferring Transferable Rewards via Active Inverse Reinforcement Learning by Victor Villin, Till Freihaut, Andreas Schlaginhaufen, Maryam Kamgarpour, Christos Dimitrakakis, Giorgia Ramponi
- Revisiting Value Iteration: Unified Analysis of Discounted and Average-Reward Cases by Arsenii Mustafin, Xinyi Sheng, Dominik Baumann
- Bellman-Admissible Scalar Losses: Dynamic Calibration, Fundamental Limits, and Misspecification Geometry by Manoj Saravanan
- The Surprising Effectiveness of Approximate Value Iteration in Self-Play by Raphael Boige, Amine Boumaza, Bruno Scherrer
- Variance-Aware Optimal Ranking in Log-Concave Random Utility Models by Diego Alovisetti, Marco Mussi, Alberto Maria Metelli
- Mind Your Own Target: Revisiting Uncertainty Quantification in Offline Reinforcement Learning by Vít Unčovský, Václav Nevyhoštěný, Petr Novotný
- AlphaExploitem: Learning to Exploit Suboptimal Play in Poker by Harnessing Complete Game Histories by Vlad Murgoci, Matthijs T. J. Spaan, Yaniv Oren
- COGNAC: Cooperative Graph-based Networked Agent Challenges for Multi-Agent Reinforcement Learning by Jules Sintes, Ana Busic
- Best Arm Identification for Bandits with Shifting Means by Lukas Zierahn, Wouter M Koolen, Shubhada Agrawal, Christina Katsimerou, Dirk van der Hoeven
- The Price of Decentralization in Top-K Arm Identification by Larissa Xu, Jasmine Nguyen, William Chang
- Trust Region Inverse Reinforcement Learning: Explicit Dual Ascent using Local Policy Updates by Anish Abhijit Diwan, Davide Tateo, Christopher Mower, Haitham Bou Ammar, Jan Peters, Oleg Arenz
- Adaptive Policy Search via Dynamic Hyperplane Partitioning by Giovanni Dispoto, Gianmarco Tedeschi, Paolo Bonetti, Marcello Restelli
- Locally-Guided Actor-Critic: Training a Goal-conditioned Actor with a Subgoal-aware Critic by Olivier Serris, Stephane Doncieux, Olivier Sigaud
- NASimJax: A GPU-Accelerated Policy Learning Framework for Penetration Testing by Raphael Simon, José Carrasquel, Elli Makdis Antoun, Wim Mees, Pieter Jules Karel Libin
Tuesday, Poster C --- 11:00 - 12:30
- Towards Understanding the Impact of Plasticity Loss on Reinforcement Learning in Stochastic Environments by Philipp Bordne, André Biedenkapp
- Continuous Monte Carlo Search by Lotfi Kobrosly, Tristan Cazenave
- A Separation Principle for Cooperative Multi-Agent Reinforcement Learning by Lucia Pezzetti, Nicolas Lanzetti, Antonio Terpin, Florian Dorfler, Giorgia Ramponi
- Is Deep RL Reproducible? State of the art and new tools by Timothée Mathieu, Juliette Achddou, Alex Davey, Hector Kohler, Philippe Preux, Julien Teigny
- Co-Exploration and Co-Exploitation via Shared Structure in Multi-Task Bandits by Sumantrak Mukherjee, Serafima Lebedeva, Jasmin Brandt, Valentin Margraf, Jonas Hanselle, Kanta Yamaoka, Viktor Bengs, Stefan Konigorski, Eyke Hüllermeier, Sebastian Josef Vollmer
- RLLBC-Lib: An Educational Code Library for Reinforcement Learning and Learning-Based Control by Bernd Frauenknecht, Emma Cramer, Artur Eisele, Paul Kruse, Lukas Kesper, Ramil Sabirov, Jyotirmaya Patra, Jonas Hertrampf, Johannes Berger, Paul Brunzema, Friedrich Solowjow, Sebastian Trimpe
- Survival Reinforcement Learning: Toward Scalable Self-Supervised RL by Franki Nguimatsia-Tiofack, Fabian Schramm, Théotime Le Hellard, Justin Carpentier
- Multivariate Distributional Reinforcement Learning Using Sliced Divergences by Baptiste Debes, Tinne Tuytelaars
- PC3D: Zero-Shot Cooperation Across Variable Rosters via Personalized Context Distillation by Ahmet Onur Akman, Rafal Kucharski
- EfficientTDMPC: Improved MPC Objectives for Sample-Efficient Continuous Control by Thomas evers, Cristian Meo, Wendelin Boehmer, Justin Dauwels, Yaniv Oren
- Optimal Sample Complexity for Single Time-Scale Actor-Critic with Momentum by Navdeep Kumar, Tehila Dahan, Lior Cohen, Ananyabrata Barua, Giorgia Ramponi, Kfir Yehuda Levy, Shie Mannor
- Handling General Constraints in Online Resource Allocation by Eleonora Fidelia Chiefari, Francesco Emanuele Stradi, Matteo Castiglioni, Alberto Marchesi
- Memory-State Critic for Asymmetric Actor-Critic with Application to Vision-Based Pursuit-Evasion by Arthur Louette, Alejandro Sánchez Roncero, Gaspard Lambrechts, Pascal Leroy, Julien Hansen, Petter Ogren, Damien Ernst
- PMCTS: Particle Monte Carlo Tree Search for Principled Parallelized Inference Time Scaling by Yaniv Oren, Viliam Vadocz, Joery A. de Vries, Wendelin Boehmer, Matthijs T. J. Spaan, Hendrik Baier
- The Challenges of Using Reinforcement Learning for Controlling Industrial Energy Systems by Tobias Lademann, Théo Vincent, Jan Peters, Matthias Weigold
- Combinatorial Bandits with Plackett-Luce Feedback: A Worst-Case Analysis by Cristiano Migali, Gianmarco Genalti, Alberto Maria Metelli, Marco Mussi
- Learning Communication Skills in Multi-task Multi-agent Deep Reinforcement Learning by Changxi Zhu, Mehdi Dastani, Shihan Wang
- Learning in Low-Dimensional Subspaces: Orthogonal Bottlenecks for Reinforcement Learning by Aleksandar Todorov, Matthia Sabatelli
- A Perturbation Approach to Unconstrained Linear Bandits by Andrew Jacobsen, Dorian Baudry, Shinji Ito, Nicolò Cesa-Bianchi
- Hierarchical Goal Abstractions via Learned Subset Relations by Fabian Wurzberger, Sebastian Gottwald, Zeqiang Zhang, Daniel Alexander Braun
- SHARPIE: A Modular Framework for Reinforcement Learning and Human-AI Interaction Experiments by Libio Goncalves Braz, Kevin Godin-Dubois, Floris den Hengst, Hüseyin Aydın, Kim Baraka, Frans A Oliehoek, Shihan Wang
- Times Series Meet MDPs for Patient Follow Up by Michalak Nicolas, Emilie Kaufmann, Timothée Mathieu, Philippe Preux
- MODIP: Efficient Model-Based Optimization for Diffusion Policies by Zakariae EL ASRI, Philippe Gratias-Quiquandon, Nicolas THOME, Olivier Sigaud
- Differentiating Bisimulation Metrics: A Framework for Parametric Markov Chain Fitting via Bicausal Optimal Transport by Sergio Calo, Amy Zhang, Javier Segovia-Aguas, Anders Jonsson
- A Goal-Set Characterization of Task Composition in the Boolean Task Algebra by Eduardo Terres-Caballero, Herke van Hoof
- Correcting Within-Group Self-Selection Bias in Prioritized Replay by Oscar Miró López-Feliu, Herke van Hoof
- Stochastic Decision Horizons for Constrained Reinforcement Learning by Nikola Milosevic, Leonard T. Franz, Daniel Haeufle, Georg Martius, Nico Scherf, Pavel Kolev
- A Survey of Reinforcement Learning for Autonomous Air Combat: Current Progresses and Limitations by Alex Pierron, Thibault Lahire
- Robust Successor Features by Erik Nikulski, Yamen Habib, Vicenç Gomez, Anders Jonsson, Rubén Moreno-Bote, Javier Segovia-Aguas
- Who's Winning? Identifying Nash Equilibrium from Improvement Feedback by Cyrille Kone, Giorgia Ramponi
Tuesday, Poster D --- 16:00 - 18:00
- Non-asymptotic Convergence of Average-reward Q-learning with Options by Kintan Saha, Ahana Deb, Anders Jonsson, Debabrota Basu
- Wind farm power tracking using reinforcement learning for secondary frequency regulation by Baptiste Corban, Ana Busic, Donatien Dubuc, Jiamin Zhu
- Global Optimality for Constrained Exploration via Penalty Regularization by Florian Wolf, Ilyas Fatkhullin, Niao He
- When Does Interaction Help? Representational Tradeoffs in Value-Based Imitation Learning by Luca Viano, Antoine Moulin, Audrey Huang, Volkan Cevher, Philip Amortila, Dylan J Foster
- Seldonian-Inspired Distributional Epistemic Shielding by Cordioli Davide, Alessandro Farinelli, Alberto Castellini
- A KL-regularization Framework for Learning to Plan with Adaptive Priors by Alvaro Serra-Gomez, Daniel Jarne Ornia, Dhruva Tirumala, Thomas M. Moerland
- Locally Coordinated Monte Carlo Planning for Constrained Multi-Agent POMDPs by Sjoerd A. J. N. Jansen, Maris F. L. Galesloot, Thiago D. Simão, Nils Jansen
- Towards a Practical Understanding of Lagrangian Methods in Safe Reinforcement Learning by Lindsay Spoor, Alvaro Serra-Gomez, Aske Plaat, Thomas M. Moerland
- Control-centric Representation Learning using Action-free Datasets with Distinct Policies by Max Rudolph, Rohan Patel, Alexander Levine, Peter Stone, Amy Zhang
- Learning When to Trust in Contextual Social Bandits by Majid Ghasemi, Mark Crowley
- From Demonstrations to Rewards: Test-Time Prompt Optimization for VLM Reward Models by Christian Gumbsch, Leonardo Barcellona, Lennard Schuenemann, Platon Karageorgis, Andrii Zadaianchuk, Zehao Wang, Sergey Zakharov, Fabien Despinoy, Rahaf Aljundi, Stratis Gavves
- Trajectory First: A Curriculum for Discovering Diverse Policies by Cornelius V. Braun, Sayantan Auddy, Marc Toussaint
- Instance-dependent Stochastic Lipschitz Bandit by Marius Potfer, Vianney Perchet
- Do Not Trust the Auctioneer: Learning to Bid in Feedback-Manipulated Auctions by Luigi Foscari, Matilde Tullii, Vianney Perchet
- On $\epsilon$-Greedy Exploration in the Presence of Change by Paul Kruse, Johannes Berger, Friedrich Solowjow
- MAVRL: Learning Reward Functions from Multiple Feedback Types with Amortized Variational Inference by Raphaël Baur, Yannick Metz, Maria Gkoulta, Mennatallah El-Assady, Giorgia Ramponi, Thomas Kleine Buening
- Centralized-to-Decentralized Policy Distillation for Efficient Multi-Agent Reinforcement Learning by Maciej Wojtala, Bogusz Stefanczyk, Dominik Jacek Bogucki, Łukasz Eugeniusz Lepak, Paweł Wawrzyński
- A Novel Approach to Distributional Reinforcement Learning via Moment Matching by Juliet Bringas Miranda, Aurélien Garivier, Olivier Cappé
- Distributionally Robust Warm Start for a Population of Bandits by Sumantrak Mukherjee, Debabrota Basu, Jasmin Brandt, Viktor Bengs, Eyke Hüllermeier, Sebastian Josef Vollmer
- BluffJAX: Adversarial Imperfect Information Games in JAX by Aryaman Reddi, Jan Peters, Carlo D'Eramo
- Uncertainty-Aware Predictive Safety Filters for Probabilistic Neural Network Dynamics by Lukas Kesper, Bernd Frauenknecht, Daniel Mayfrank, Henrik Hose, Sebastian Trimpe
- Unsupervised Behavioral Compression: Learning Low-Dimensional Policy Manifolds through State-Occupancy Matching by Andrea Fraschini, Davide Tenedini, Riccardo Zamboni, Mirco Mutti, Marcello Restelli
- Gradient Iterated Temporal-Difference Learning by Théo Vincent, Kevin Gerhardt, Yogesh Tripathi, Habib Maraqten, Adam White, Martha White, Jan Peters, Carlo D'Eramo
- Better Slots, Better Worlds: Representation Quality & Robustness in Object-Centric World Models by Shukrullo Nazirjonov, Sai Prasanna, Anna Manasyan, Georg Martius
- The Sampling Complexity of Condorcet Winner Identification in Dueling Bandits by El Mehdi Saad, Victor Thuot, Nicolas Verzelen
- Near Cost-Optimal Best-Arm Identification with LLM Judges by Yassir Jedra, Aymen Al Marjani, Ziyad Benomar
- Octax: Accelerated CHIP-8 Arcade Environments for Reinforcement Learning in JAX by Waris Radji, Thomas Michel, Hector Piteau
- Revisiting Optimism in Deterministic Bandits by Lorenzo Croissant, Yurong Chen
- Towards instance-dependent regret optimality in Episodic MDPs with Posterior Sampling by Victor Boone, Dorian Baudry, Odalric-Ambrym Maillard, Cyrille Kone, Waris Radji
- Randomized Least Squares Value Iteration itself is Joint Differentially Private by Haiyang Lu, Pratik Gajane, Shaojie Bai, M. Sadegh Talebi
Wednesday, Poster E --- 11:00 - 12:30
- Multiple-Frequencies Population-Based Training by Waël Doulazmi, Auguste Lehuger, Marin Toromanoff, Valentin Charraut, Thibault Buhet, Fabien Moutarde
- Improved Algorithms for Online Classification with Surrogate Losses by Abed Razawy, Valentina Masarotto, Dirk van der Hoeven
- Performative Policy Gradient: Optimality in Performative Reinforcement Learning by Debabrota Basu, Udvas Das, Brahim Driss, Uddalak Mukherjee
- MESHA: Mechanism-Enforced Sequential Halving for Strategic Linear Bandits by Xin Li, Zixin Zhong
- Plasticity-Based Analysis of Recent CNN Encoders in Pixel-Based RL by Thomas Delliaux, Vincent Francois-Lavet, Emmanuel Rachelson
- Hierarchical inference with a finite offload queue by Afroditi Letsiou, Jaya Prakash Champati, Ayalvadi Ganesh, James Richard Gross, Parimal Parag
- Guided Flow Policy: Learning from High-Value Actions in Offline Reinforcement Learning by Franki Nguimatsia-Tiofack, Théotime Le Hellard, Fabian Schramm, Nicolas Perrin-Gilbert, Justin Carpentier
- TeNet: Text-to-Network for Compact Policy Synthesis by Ariyan Bighashdel, Kevin Sebastian Luck
- The Terminal Representation in Reinforcement Learning by Amir Esterhuysen, Anders Jonsson
- Generative Modeling by Value-Driven Transport by Pablo Moreno-Muñoz, Adrian Müller, Gergely Neu
- How Log-Barrier Helps Exploration in Policy Optimization by Leonardo Cesani, Matteo Papini, Marcello Restelli
- Beyond the Monolith: Temporal Credit Assignment Needs Higher-Order Causal Structure by Kenzo Clauw, Fernando Rosas, Daniele Marinazzo
- Deep SPI: Safe Policy Improvement via World Models by Florent Delgrange, Raphaël Avalos, Willem Röpke
- Gap-Independent Regret for Multi-Agent Combinatorial Semi-Bandits by Bree Chen, Khang Nguyen, Jacqueline Liu, Xingjian Li, Yuxi Luo, William Chang
- A Simple Scaling Model for Bootstrapped DQN by Roman Knyazhitskiy, Pascal R. Van der Vaart
- On the Sample Complexity of Discounted Reinforcement Learning with Optimized Certainty Equivalents by Oliver Mortensen, M. Sadegh Talebi
- Multi-agent imitation learning with function approximation: Linear Markov games and beyond by Luca Viano, Till Freihaut, Emanuele Nevali, Volkan Cevher, Matthieu Geist, Giorgia Ramponi
- Policy Planning is Minimal Among Standard Oracles for Stochastic $q^\pi$-Realizable Reinforcement Learning by Manoj Saravanan
- Safely Optimal: Pure Exploration in Bandits with Unknown Linear Constraints by Udvas Das, Achraf Azize, Debabrota Basu
- Optimal Best Arm Identification under Differential Privacy by Marc Jourdan, Achraf Azize
- Best Arm Identification with Minimal Regret by Junwen Yang, Vincent Y. F. Tan, Tianyuan Jin
- Do Not Imitate, Reinforce: Iterative Classification via Belief Refinement by Mahdi Kallel, Johannes Tölle, Ahmed Hendawy, Carlo D'Eramo
- On the Benefits of Free Exploration for Regret Minimization in Multi-Armed Bandits by Yunlong Hou, Zixin Zhong, Vincent Y. F. Tan
- Almost Sure Policy Convergence for Stochastic Bandits by Liam Schramm, Ronald Ortner
- From Intuition To Evidence: A Hyperparameter Analysis Toolkit for Online Reinforcement Learning by Theresa Eimer, Jan Felix Kleuker, Thomas M. Moerland, Marius Lindauer
- Exploration and Online Transfer with Behavioral Foundation Models by Louis Bagot, Mathieu Lefort, Laetitia Matignon