In this episode, I talk with David Lindner about Myopic Optimization with Non-myopic Approval, or MONA, which attempts to address (multi-step) reward hacking by myopically optimizing actions against a human's sense of whether those actions are generally good. Does this work? Can we get smarter-than-human AI this way? How does this compare to approaches like conservativism? Listen to find out.
Podden och tillhörande omslagsbild på den här sidan tillhör
Daniel Filan. Innehållet i podden är skapat av Daniel Filan och inte av,
eller tillsammans med, Poddtoppen.