{"as_of":"2026-08-10T00:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8f0b39176ac4ebef6461c5301621393e5cc2809fc8e4418a85897156357f70d7","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T07:22:05.850923Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2510.27329/citation-record","integrity":"/paper/2510.27329/integrity","json":"/paper/2510.27329/citation-record.json","paper":"/paper/2510.27329"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:22:01.494820Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.27329","last_updated":"2026-06-21T10:37:57Z","snapshot_observed_at":"2026-08-09T03:35:43.067137Z","submitted_at":"2025-10-31T10:00:57Z","title":"Reinforcement Learning for Long-Horizon Unordered Tasks: From Boolean to Coupled Reward Machines","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-04T07:22:01.494820Z"},"links":{"citing_paper":"/paper/2510.27329"},"observation_digest":"sha256:0567887edb77099afca1d50a8489432eb3a52c1b93101b1c646955e80463778c","observation_id":"60ee38ad-b93b-4efd-8f98-9f12364ac080","resolution":{"observed_at":"2026-08-04T07:22:01.494820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:22:01.586456Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.27329","last_updated":"2026-06-21T10:37:57Z","snapshot_observed_at":"2026-08-09T03:35:43.067137Z","submitted_at":"2025-10-31T10:00:57Z","title":"Reinforcement Learning for Long-Horizon Unordered Tasks: From Boolean to Coupled Reward Machines","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-04T07:22:01.586456Z"},"links":{"citing_paper":"/paper/2510.27329"},"observation_digest":"sha256:2fa9b89668112774072bdac413c568b675b2e208406d4425edac907ea36ce2e5","observation_id":"30bda6a6-0968-4f15-8700-8ad14a231a66","resolution":{"observed_at":"2026-08-04T07:22:01.586456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:22:01.703857Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2510.27329","last_updated":"2026-06-21T10:37:57Z","snapshot_observed_at":"2026-08-09T03:35:43.067137Z","submitted_at":"2025-10-31T10:00:57Z","title":"Reinforcement Learning for Long-Horizon Unordered Tasks: From Boolean to Coupled Reward Machines","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-04T07:22:01.703857Z"},"links":{"citing_paper":"/paper/2510.27329"},"observation_digest":"sha256:d0bb254606e745c042056e39607d4ef3a3e88982bea2bc99b98b993edd59fa3d","observation_id":"f31762de-a072-4e3b-b41b-3d34d19637e7","resolution":{"observed_at":"2026-08-04T07:22:01.703857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:22:01.849683Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2510.27329","last_updated":"2026-06-21T10:37:57Z","snapshot_observed_at":"2026-08-09T03:35:43.067137Z","submitted_at":"2025-10-31T10:00:57Z","title":"Reinforcement Learning for Long-Horizon Unordered Tasks: From Boolean to Coupled Reward Machines","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-04T07:22:01.849683Z"},"links":{"citing_paper":"/paper/2510.27329"},"observation_digest":"sha256:22d71f48bfbe5097dacaba92152543c29a10b6f95a5167d9016940bc85f729cf","observation_id":"aadc17ee-3eb9-4797-96b6-2d16f121f947","resolution":{"observed_at":"2026-08-04T07:22:01.849683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:22:02.084791Z","title":"T.; Klassen, T","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2510.27329","last_updated":"2026-06-21T10:37:57Z","snapshot_observed_at":"2026-08-09T03:35:43.067137Z","submitted_at":"2025-10-31T10:00:57Z","title":"Reinforcement Learning for Long-Horizon Unordered Tasks: From Boolean to Coupled Reward Machines","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-04T07:22:02.084791Z"},"links":{"citing_paper":"/paper/2510.27329"},"observation_digest":"sha256:78ed14f83c92e8cb6ff86e03ec41d7627ab4a7f958a5e4ea1844e3676237b6a0","observation_id":"aef4d452-0092-4735-bcf7-9098b23185e2","resolution":{"observed_at":"2026-08-04T07:22:02.084791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:22:02.205642Z","title":"C.; Di Nunzio, L.; Fazzolari, R.; Giardino, D.; Re, M.; and Span \\`o , S","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.27329","last_updated":"2026-06-21T10:37:57Z","snapshot_observed_at":"2026-08-09T03:35:43.067137Z","submitted_at":"2025-10-31T10:00:57Z","title":"Reinforcement Learning for Long-Horizon Unordered Tasks: From Boolean to Coupled Reward Machines","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-04T07:22:02.205642Z"},"links":{"citing_paper":"/paper/2510.27329"},"observation_digest":"sha256:72d05f333cfc8de53692fc30a0f79d140ac25ad2d54ff11c8ee6de63d18e24eb","observation_id":"8121e214-7a63-4f95-8f5d-b2dc1bddcee6","resolution":{"observed_at":"2026-08-04T07:22:02.205642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:22:02.415694Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.27329","last_updated":"2026-06-21T10:37:57Z","snapshot_observed_at":"2026-08-09T03:35:43.067137Z","submitted_at":"2025-10-31T10:00:57Z","title":"Reinforcement Learning for Long-Horizon Unordered Tasks: From Boolean to Coupled Reward Machines","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-04T07:22:02.415694Z"},"links":{"citing_paper":"/paper/2510.27329"},"observation_digest":"sha256:760ec6286d8aad6ac830095e1c6f105989c769c395a4b237dae48052c1bab7c5","observation_id":"67150340-0d77-4d8d-87a6-f3759208b471","resolution":{"observed_at":"2026-08-04T07:22:02.415694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:22:02.495764Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.27329","last_updated":"2026-06-21T10:37:57Z","snapshot_observed_at":"2026-08-09T03:35:43.067137Z","submitted_at":"2025-10-31T10:00:57Z","title":"Reinforcement Learning for Long-Horizon Unordered Tasks: From Boolean to Coupled Reward Machines","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-04T07:22:02.495764Z"},"links":{"citing_paper":"/paper/2510.27329"},"observation_digest":"sha256:040c97d4c7f8459294770ee50e1faf0ed74e02430835099be3e7740159eacdf5","observation_id":"8f39e8e8-14ef-4155-9bad-0c927ae9bbef","resolution":{"observed_at":"2026-08-04T07:22:02.495764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:22:02.660494Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.27329","last_updated":"2026-06-21T10:37:57Z","snapshot_observed_at":"2026-08-09T03:35:43.067137Z","submitted_at":"2025-10-31T10:00:57Z","title":"Reinforcement Learning for Long-Horizon Unordered Tasks: From Boolean to Coupled Reward Machines","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-04T07:22:02.660494Z"},"links":{"citing_paper":"/paper/2510.27329"},"observation_digest":"sha256:f593ef45ee0a31b6722143cd08bd5dc56ac62b16c4ffd4990cb7bbf670e5f640","observation_id":"aa8173e9-45f2-43ba-92cc-575d2b078851","resolution":{"observed_at":"2026-08-04T07:22:02.660494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:22:02.818652Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.27329","last_updated":"2026-06-21T10:37:57Z","snapshot_observed_at":"2026-08-09T03:35:43.067137Z","submitted_at":"2025-10-31T10:00:57Z","title":"Reinforcement Learning for Long-Horizon Unordered Tasks: From Boolean to Coupled Reward Machines","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-04T07:22:02.818652Z"},"links":{"citing_paper":"/paper/2510.27329"},"observation_digest":"sha256:374c9a847ab2e38db7d7ee679194ff012284c24b506de0b318a61b36b56f71fe","observation_id":"ee9f5f3c-eb77-44be-9239-1f44cd14990a","resolution":{"observed_at":"2026-08-04T07:22:02.818652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:22:02.916971Z","title":"T.; Klassen, T","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.27329","last_updated":"2026-06-21T10:37:57Z","snapshot_observed_at":"2026-08-09T03:35:43.067137Z","submitted_at":"2025-10-31T10:00:57Z","title":"Reinforcement Learning for Long-Horizon Unordered Tasks: From Boolean to Coupled Reward Machines","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-04T07:22:02.916971Z"},"links":{"citing_paper":"/paper/2510.27329"},"observation_digest":"sha256:44ee8279734c7067591c2458a2231b048d579807bbc11a01f00f33f201660b93","observation_id":"fc0c8680-36dd-4408-b954-6eef134a1d82","resolution":{"observed_at":"2026-08-04T07:22:02.916971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:22:03.044745Z","title":"T.; and McIlraith, S","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.27329","last_updated":"2026-06-21T10:37:57Z","snapshot_observed_at":"2026-08-09T03:35:43.067137Z","submitted_at":"2025-10-31T10:00:57Z","title":"Reinforcement Learning for Long-Horizon Unordered Tasks: From Boolean to Coupled Reward Machines","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-04T07:22:03.044745Z"},"links":{"citing_paper":"/paper/2510.27329"},"observation_digest":"sha256:c1386800d5d8be98176ee07e0a5956f0e9c8c4b34df47eec504eaabfc4035623","observation_id":"b6a00321-4b07-469f-ad4d-d5a62f03555c","resolution":{"observed_at":"2026-08-04T07:22:03.044745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:22:03.193495Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.27329","last_updated":"2026-06-21T10:37:57Z","snapshot_observed_at":"2026-08-09T03:35:43.067137Z","submitted_at":"2025-10-31T10:00:57Z","title":"Reinforcement Learning for Long-Horizon Unordered Tasks: From Boolean to Coupled Reward Machines","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-04T07:22:03.193495Z"},"links":{"citing_paper":"/paper/2510.27329"},"observation_digest":"sha256:12f4c4d4f52c561858f8b3c51fcb6b294a6789d134aeb344884180a464ac9116","observation_id":"fc329aa7-9d90-40ef-b5ce-ddb038df35f0","resolution":{"observed_at":"2026-08-04T07:22:03.193495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:22:03.345637Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2510.27329","last_updated":"2026-06-21T10:37:57Z","snapshot_observed_at":"2026-08-09T03:35:43.067137Z","submitted_at":"2025-10-31T10:00:57Z","title":"Reinforcement Learning for Long-Horizon Unordered Tasks: From Boolean to Coupled Reward Machines","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-04T07:22:03.345637Z"},"links":{"citing_paper":"/paper/2510.27329"},"observation_digest":"sha256:6f74bd3062f943150f967ff678841b005999a879a43c9bd5792895b843662849","observation_id":"083b3ea7-e1c8-4d7d-aae4-d34ee71ce940","resolution":{"observed_at":"2026-08-04T07:22:03.345637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:22:03.512091Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.27329","last_updated":"2026-06-21T10:37:57Z","snapshot_observed_at":"2026-08-09T03:35:43.067137Z","submitted_at":"2025-10-31T10:00:57Z","title":"Reinforcement Learning for Long-Horizon Unordered Tasks: From Boolean to Coupled Reward Machines","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-04T07:22:03.512091Z"},"links":{"citing_paper":"/paper/2510.27329"},"observation_digest":"sha256:c0e6fb3fd4f2a1caade54250ffd97d19589874a4a2a75a84dd166dd8251a0a9e","observation_id":"84981524-30f8-4d08-9227-ec83e1aa7956","resolution":{"observed_at":"2026-08-04T07:22:03.512091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:22:03.617089Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2510.27329","last_updated":"2026-06-21T10:37:57Z","snapshot_observed_at":"2026-08-09T03:35:43.067137Z","submitted_at":"2025-10-31T10:00:57Z","title":"Reinforcement Learning for Long-Horizon Unordered Tasks: From Boolean to Coupled Reward Machines","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-04T07:22:03.617089Z"},"links":{"citing_paper":"/paper/2510.27329"},"observation_digest":"sha256:a1704dec87e497c5d717caeea608294c847922e7b654305a4b56110f01b08e69","observation_id":"b64f9050-e377-4f55-bedd-d05e37f11c32","resolution":{"observed_at":"2026-08-04T07:22:03.617089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:22:03.688661Z","title":"u ller, M.; Sch \\","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.27329","last_updated":"2026-06-21T10:37:57Z","snapshot_observed_at":"2026-08-09T03:35:43.067137Z","submitted_at":"2025-10-31T10:00:57Z","title":"Reinforcement Learning for Long-Horizon Unordered Tasks: From Boolean to Coupled Reward Machines","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-04T07:22:03.688661Z"},"links":{"citing_paper":"/paper/2510.27329"},"observation_digest":"sha256:764342b9959abe629113f95f18fcbaaedadefb3d08e3dd60822ddc18793eded7","observation_id":"92dd31f8-f461-4f07-a689-c3250bebce7d","resolution":{"observed_at":"2026-08-04T07:22:03.688661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:22:03.757028Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2510.27329","last_updated":"2026-06-21T10:37:57Z","snapshot_observed_at":"2026-08-09T03:35:43.067137Z","submitted_at":"2025-10-31T10:00:57Z","title":"Reinforcement Learning for Long-Horizon Unordered Tasks: From Boolean to Coupled Reward Machines","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-04T07:22:03.757028Z"},"links":{"citing_paper":"/paper/2510.27329"},"observation_digest":"sha256:c2ca54fcfc1b38f39978df90a855727bfe621551878336ee555905b00c713d53","observation_id":"a47a56e2-2645-4730-b5e7-c336bbeb6242","resolution":{"observed_at":"2026-08-04T07:22:03.757028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1509.02971","last_updated":"2019-07-05T10:47:27Z","snapshot_observed_at":"2026-07-06T04:29:24.362640Z","submitted_at":"2015-09-09T23:01:36Z","title":"Continuous control with deep reinforcement learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.02971","snapshot_observed_at":"2026-08-04T07:22:03.852431Z","title":"P.; Hunt, J","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2510.27329","last_updated":"2026-06-21T10:37:57Z","snapshot_observed_at":"2026-08-09T03:35:43.067137Z","submitted_at":"2025-10-31T10:00:57Z","title":"Reinforcement Learning for Long-Horizon Unordered Tasks: From Boolean to Coupled Reward Machines","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-04T07:22:03.852431Z"},"links":{"cited_paper":"/paper/1509.02971","citing_paper":"/paper/2510.27329"},"observation_digest":"sha256:8961933dee7ac956a7b841a4d8491a88f70fce3da913c7308812bad1a1073346","observation_id":"d58323c4-33dc-4f76-b6ab-18a439dda81c","resolution":{"observed_at":"2026-08-04T07:22:03.852431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00429","last_updated":"2022-07-01T13:48:29Z","snapshot_observed_at":"2026-07-06T13:26:52.235619Z","submitted_at":"2022-07-01T13:48:29Z","title":"Modular Lifelong Reinforcement Learning via Neural Composition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.00429","snapshot_observed_at":"2026-08-04T07:22:04.013797Z","title":"A.; van Seijen, H.; and Eaton, E","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.27329","last_updated":"2026-06-21T10:37:57Z","snapshot_observed_at":"2026-08-09T03:35:43.067137Z","submitted_at":"2025-10-31T10:00:57Z","title":"Reinforcement Learning for Long-Horizon Unordered Tasks: From Boolean to Coupled Reward Machines","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-04T07:22:04.013797Z"},"links":{"cited_paper":"/paper/2207.00429","citing_paper":"/paper/2510.27329"},"observation_digest":"sha256:9ac98e93010b044b54a2ca6a018127121b27f649fd34afb9b6c9bfa03bdea1e9","observation_id":"3bf465c4-6af0-4a52-8f38-abea83477fb3","resolution":{"observed_at":"2026-08-04T07:22:04.013797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:22:04.220326Z","title":"A.; Veness, J.; Bellemare, M","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2510.27329","last_updated":"2026-06-21T10:37:57Z","snapshot_observed_at":"2026-08-09T03:35:43.067137Z","submitted_at":"2025-10-31T10:00:57Z","title":"Reinforcement Learning for Long-Horizon Unordered Tasks: From Boolean to Coupled Reward Machines","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-04T07:22:04.220326Z"},"links":{"citing_paper":"/paper/2510.27329"},"observation_digest":"sha256:4542e205694c29abbc46d34b50067db2a4415c71341f413d2ad63d6614a104d0","observation_id":"75f463ab-039e-419b-9ae6-1fc17d476b98","resolution":{"observed_at":"2026-08-04T07:22:04.220326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:22:04.368793Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.27329","last_updated":"2026-06-21T10:37:57Z","snapshot_observed_at":"2026-08-09T03:35:43.067137Z","submitted_at":"2025-10-31T10:00:57Z","title":"Reinforcement Learning for Long-Horizon Unordered Tasks: From Boolean to Coupled Reward Machines","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-04T07:22:04.368793Z"},"links":{"citing_paper":"/paper/2510.27329"},"observation_digest":"sha256:1de302e84b1c7f2d29741b72b62aeb01778e8c36840217479964e732f8c0d2cc","observation_id":"d62438cc-deb9-4392-9457-6de9dd91da95","resolution":{"observed_at":"2026-08-04T07:22:04.368793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:22:04.512375Z","title":"Y.; Harada, D.; and Russell, S","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2510.27329","last_updated":"2026-06-21T10:37:57Z","snapshot_observed_at":"2026-08-09T03:35:43.067137Z","submitted_at":"2025-10-31T10:00:57Z","title":"Reinforcement Learning for Long-Horizon Unordered Tasks: From Boolean to Coupled Reward Machines","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-04T07:22:04.512375Z"},"links":{"citing_paper":"/paper/2510.27329"},"observation_digest":"sha256:2275acc40eeff1e17a2278d56681e1d914a6ba3bacdb00840f4395a8cc355ee4","observation_id":"088352b7-6e21-4fac-bd70-e1b01fc23d4c","resolution":{"observed_at":"2026-08-04T07:22:04.512375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:22:04.654376Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.27329","last_updated":"2026-06-21T10:37:57Z","snapshot_observed_at":"2026-08-09T03:35:43.067137Z","submitted_at":"2025-10-31T10:00:57Z","title":"Reinforcement Learning for Long-Horizon Unordered Tasks: From Boolean to Coupled Reward Machines","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-04T07:22:04.654376Z"},"links":{"citing_paper":"/paper/2510.27329"},"observation_digest":"sha256:a863fed9780c12a3a9536463502e8fb47832a4650bb2bd801209bb73d76d5bc8","observation_id":"0ca057a4-3a4d-40ce-b829-8733ff2092aa","resolution":{"observed_at":"2026-08-04T07:22:04.654376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:22:04.859930Z","title":"N.; Wright, R.; Velasquez, A.; and Sinapov, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.27329","last_updated":"2026-06-21T10:37:57Z","snapshot_observed_at":"2026-08-09T03:35:43.067137Z","submitted_at":"2025-10-31T10:00:57Z","title":"Reinforcement Learning for Long-Horizon Unordered Tasks: From Boolean to Coupled Reward Machines","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-04T07:22:04.859930Z"},"links":{"citing_paper":"/paper/2510.27329"},"observation_digest":"sha256:20c59ae22c376bf57eb6b778ba1fd0fccce3a5dd2ceda0b79bf49c857ba18301","observation_id":"b9a5b734-d376-496d-856e-0e7f65fa0f4a","resolution":{"observed_at":"2026-08-04T07:22:04.859930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:22:05.019402Z","title":null,"venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2510.27329","last_updated":"2026-06-21T10:37:57Z","snapshot_observed_at":"2026-08-09T03:35:43.067137Z","submitted_at":"2025-10-31T10:00:57Z","title":"Reinforcement Learning for Long-Horizon Unordered Tasks: From Boolean to Coupled Reward Machines","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-04T07:22:05.019402Z"},"links":{"citing_paper":"/paper/2510.27329"},"observation_digest":"sha256:67858d77eb47c1401619b3877229a6a8d7b52b3f2bfcab17ce1c75b3e8eddaac","observation_id":"1c8d9118-9459-46d6-ac0f-2f204ff6216a","resolution":{"observed_at":"2026-08-04T07:22:05.019402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:22:05.203791Z","title":"B.; Talbert, D","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.27329","last_updated":"2026-06-21T10:37:57Z","snapshot_observed_at":"2026-08-09T03:35:43.067137Z","submitted_at":"2025-10-31T10:00:57Z","title":"Reinforcement Learning for Long-Horizon Unordered Tasks: From Boolean to Coupled Reward Machines","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-04T07:22:05.203791Z"},"links":{"citing_paper":"/paper/2510.27329"},"observation_digest":"sha256:4964482300bd03c34165598fd182e5beab9db3e7def1ee5d0a891882ff68a38f","observation_id":"4bfa9be9-6269-4a47-b9d2-1010079e5e65","resolution":{"observed_at":"2026-08-04T07:22:05.203791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:22:05.367931Z","title":"S.; and Barto, A","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2510.27329","last_updated":"2026-06-21T10:37:57Z","snapshot_observed_at":"2026-08-09T03:35:43.067137Z","submitted_at":"2025-10-31T10:00:57Z","title":"Reinforcement Learning for Long-Horizon Unordered Tasks: From Boolean to Coupled Reward Machines","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-04T07:22:05.367931Z"},"links":{"citing_paper":"/paper/2510.27329"},"observation_digest":"sha256:20b770a5636465ca724a196d0ab35f04c1d640a50d9125c7fb918c3c908d37ec","observation_id":"7f36fb87-e2bb-49c3-933b-744a217b44ae","resolution":{"observed_at":"2026-08-04T07:22:05.367931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:22:05.518457Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.27329","last_updated":"2026-06-21T10:37:57Z","snapshot_observed_at":"2026-08-09T03:35:43.067137Z","submitted_at":"2025-10-31T10:00:57Z","title":"Reinforcement Learning for Long-Horizon Unordered Tasks: From Boolean to Coupled Reward Machines","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-04T07:22:05.518457Z"},"links":{"citing_paper":"/paper/2510.27329"},"observation_digest":"sha256:c70879d5768f9ca1d105387dc3e46e646c90d245bf45b6e7bcbf6b4639b014f7","observation_id":"2a49a3c4-083a-4f66-a534-5d853fbb78c2","resolution":{"observed_at":"2026-08-04T07:22:05.518457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:22:05.695724Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2510.27329","last_updated":"2026-06-21T10:37:57Z","snapshot_observed_at":"2026-08-09T03:35:43.067137Z","submitted_at":"2025-10-31T10:00:57Z","title":"Reinforcement Learning for Long-Horizon Unordered Tasks: From Boolean to Coupled Reward Machines","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-04T07:22:05.695724Z"},"links":{"citing_paper":"/paper/2510.27329"},"observation_digest":"sha256:9d08c88147dc068e548c7f4883cb7f4a8dff8b1b65644773d7880d7e9b80b499","observation_id":"08e497c5-5e88-40c2-af1a-71c957a70d89","resolution":{"observed_at":"2026-08-04T07:22:05.695724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:22:05.850923Z","title":"J.; and Dayan, P","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2510.27329","last_updated":"2026-06-21T10:37:57Z","snapshot_observed_at":"2026-08-09T03:35:43.067137Z","submitted_at":"2025-10-31T10:00:57Z","title":"Reinforcement Learning for Long-Horizon Unordered Tasks: From Boolean to Coupled Reward Machines","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-04T07:22:05.850923Z"},"links":{"citing_paper":"/paper/2510.27329"},"observation_digest":"sha256:387201bfea04ea356e68741fee5ee98f9bc520b1a298aabae2575698e1a5bb0a","observation_id":"d414bbdf-1bf4-4d45-86d6-aaa5d4020e3f","resolution":{"observed_at":"2026-08-04T07:22:05.850923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2510.27329","last_updated":"2026-06-21T10:37:57Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-09T03:35:43.067137Z","submitted_at":"2025-10-31T10:00:57Z","title":"Reinforcement Learning for Long-Horizon Unordered Tasks: From Boolean to Coupled Reward Machines"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 0 inbound Pith citation observations for arXiv:2510.27329."}