{"as_of":"2026-08-20T15:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:59e9fecdde82ef9e96bae3393efffa0bcfcedb14f950cf64a95e64c1a4390709","coverage":[{"denominator":61,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":61,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T21:01:22.868400Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.11153/citation-record","integrity":"/paper/2505.11153/integrity","json":"/paper/2505.11153/citation-record.json","paper":"/paper/2505.11153"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:23.701548Z","title":"Reinforcement learning in game industry—review, prospects and challenges,","venue":null,"work_id":"7357c619-80af-4021-9eca-f89559adcaea","year":2023},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-19T02:52:55.887651Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.596392Z"},"links":{"citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:50e4da4654dc95c8982138e08357c72100d2bf470a797a94c684df0d960f5507","observation_id":"1868bd64-3169-486a-ac63-7bef0f6ee600","resolution":{"observed_at":"2026-08-15T21:01:23.706877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:22.601706Z","title":"Artificial intelligence, machine learning and deep learning in advanced robotics, a review,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-19T02:52:55.887651Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.601706Z"},"links":{"citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:bff69157e76aafebdea2f14c84a0a3e8c2d34114d001bad3f4faa044c9509770","observation_id":"5b36d62b-6933-4947-ad82-0c273075a833","resolution":{"observed_at":"2026-08-15T21:01:22.601706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.5602","last_updated":"2013-12-19T16:00:08Z","snapshot_observed_at":"2026-08-17T17:19:33.060917Z","submitted_at":"2013-12-19T16:00:08Z","title":"Playing Atari with Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.5602","snapshot_observed_at":"2026-08-15T21:01:22.606744Z","title":"Playing atari with deep reinforcement learning,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-19T02:52:55.887651Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.606744Z"},"links":{"cited_paper":"/paper/1312.5602","citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:9b2c0e0d9848af5ccefee102ba793e6894bebf7510e29b28bfb2d426ca2022e9","observation_id":"afb15a91-ee65-49f1-81ff-92498e50dd95","resolution":{"observed_at":"2026-08-15T21:01:22.606744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:23.678065Z","title":"Weakly coupled deep q-networks,","venue":null,"work_id":"3fe0384c-210e-47f8-9267-2c0281d9dfe9","year":2024},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-19T02:52:55.887651Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.611371Z"},"links":{"citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:3c3b1b8e262237a739c2d5327b8d1434db8e347e05a1f0b87b8ef2c4c792637d","observation_id":"f0d16ee2-0918-4a41-9bc0-b48eeb8b0c50","resolution":{"observed_at":"2026-08-15T21:01:23.682572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:23.664085Z","title":"Tuning apex dqn: A reinforcement learning based deep q-network algorithm,","venue":null,"work_id":"e14af9c4-baab-49b8-aac2-141970e460c2","year":2024},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-19T02:52:55.887651Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.616440Z"},"links":{"citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:1576cdf3f554b0dd96f2b04425e1fdbb88c57d56726c314a3c4db45f1f516cbc","observation_id":"2ca25150-c058-45a0-950c-fe3891c86abf","resolution":{"observed_at":"2026-08-15T21:01:23.668685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:23.650532Z","title":"Safe reinforcement learning via shielding under partial observability,","venue":null,"work_id":"2c1b15e9-9598-408f-b092-b78aa1150838","year":2023},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-19T02:52:55.887651Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.620781Z"},"links":{"citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:e030d98bce4bd1f4148f46609e547c229262e1d4b940d86cdb3617daadafa3f2","observation_id":"0e111d3c-b700-45ee-8af1-df7aa143c6ae","resolution":{"observed_at":"2026-08-15T21:01:23.654874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:23.637011Z","title":"Integrated task and motion planning for safe legged navigation in partially observable environments,","venue":null,"work_id":"89231479-d552-43b1-bb42-5cf88b9a0cf1","year":2023},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-19T02:52:55.887651Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.625634Z"},"links":{"citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:4e40f6c39f5c498e0f878709811fdd4b8c667dcea913a861eb969aac05de2cf9","observation_id":"c0c88722-5cad-4be5-be71-14d9dad8da2e","resolution":{"observed_at":"2026-08-15T21:01:23.641601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:22.629718Z","title":"Deep reinforcement learning for multiagent systems: A review of challenges, solutions, and applications,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-19T02:52:55.887651Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.629718Z"},"links":{"citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:b8bd592dbec61f72b3c329fff18509e01612d05ebdeef874d77b108585485317","observation_id":"2a3f48f8-7f06-47b2-a650-a797f9fb2ba3","resolution":{"observed_at":"2026-08-15T21:01:22.629718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:22.633844Z","title":"A definition of continual reinforcement learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-19T02:52:55.887651Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.633844Z"},"links":{"citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:6622cc70d4fe5021e7c07b8c38cb5e871ca9efb3edb062e858bca4d27fb42820","observation_id":"95640671-922e-4ad1-b63e-a3f8ee8426f4","resolution":{"observed_at":"2026-08-15T21:01:22.633844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:23.605908Z","title":"Deep reinforcement learning unleashing the power of ai in decision-making,","venue":null,"work_id":"ed3f9b4d-9204-4301-a972-2de1703bb8fe","year":2024},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-19T02:52:55.887651Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.638178Z"},"links":{"citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:cef18dc7b728204848b8dc50e5ce3f9efc6efd9fb2a82a9e1cf84f5deb89e139","observation_id":"0d9b6466-e0f7-4ed8-a408-370001b6650b","resolution":{"observed_at":"2026-08-15T21:01:23.610494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:22.642683Z","title":"Exploration in deep reinforcement learning: A survey,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-19T02:52:55.887651Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.642683Z"},"links":{"citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:2ab5808a8c17571020584225d818c7567dd80a6539a0c848d9ab57ec774936b7","observation_id":"b554e27a-280c-45c4-89ba-5f6b8de6cda1","resolution":{"observed_at":"2026-08-15T21:01:22.642683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:22.646843Z","title":"Memory gym: Partially observable challenges to memory-based agents,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-19T02:52:55.887651Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.646843Z"},"links":{"citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:dfda315c8c015e5b23f82a94884642dfaf6b34029b8bbdea34da73415a57a663","observation_id":"ca5fec4b-57dc-47e4-bf84-fa36857fee63","resolution":{"observed_at":"2026-08-15T21:01:22.646843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:23.574654Z","title":"Deep rein- forcement learning: A survey,","venue":null,"work_id":"df009d18-cd49-4c10-bcc6-ac047509fb35","year":2022},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-19T02:52:55.887651Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.655825Z"},"links":{"citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:b21d9f477a2fc20d2302da22fd6712f565ec8b86fbb1d94e69e40d15c6a2b901","observation_id":"0657da13-58f0-4684-8e76-e35f23d2df8e","resolution":{"observed_at":"2026-08-15T21:01:23.579178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.07599","last_updated":"2021-07-15T20:38:22Z","snapshot_observed_at":"2026-08-17T08:10:27.884796Z","submitted_at":"2021-07-15T20:38:22Z","title":"Partially Observable Markov Decision Processes (POMDPs) and Robotics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.07599","snapshot_observed_at":"2026-08-15T21:01:22.659923Z","title":"Partially observable markov decision processes (pomdps) and robotics,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-19T02:52:55.887651Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.659923Z"},"links":{"cited_paper":"/paper/2107.07599","citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:fddab56c4db9f9f6d3969141b8910cf57f6be1d3b5006464271ecbd434dda909","observation_id":"5f247310-6da1-4525-b271-3e4b7100aa90","resolution":{"observed_at":"2026-08-15T21:01:22.659923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:23.560722Z","title":"Recurrent neural networks,","venue":null,"work_id":"d5f52356-b559-4b1d-8787-a73ed1d159f3","year":2001},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-19T02:52:55.887651Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.664501Z"},"links":{"citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:5fbc15133ad41166fa0caa7c0414f0ccb1ddd81280acf9d5c801137e16239a2f","observation_id":"179ec413-502f-4197-b9b0-e231b42dee0c","resolution":{"observed_at":"2026-08-15T21:01:23.565191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:22.669081Z","title":"Long short-term memory,","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-19T02:52:55.887651Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.669081Z"},"links":{"citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:8a7b98d8f110b1ce28341717cd780a6bb848dc4fc9b1e92ecf064abc782052a1","observation_id":"5508d405-6ba2-44ff-a703-bd4ae0ce2130","resolution":{"observed_at":"2026-08-15T21:01:22.669081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:23.538772Z","title":"Gate-variants of gated recurrent unit (gru) neural networks,","venue":null,"work_id":"f22102d1-8a9c-4cbd-ab21-2bbb4645742e","year":2017},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-19T02:52:55.887651Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.673326Z"},"links":{"citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:1b234f0a22952442214c28d584c1364a05b8df2042aaadf1b51084ac5149c444","observation_id":"6c3462ee-db52-4081-a500-2e68d82f52db","resolution":{"observed_at":"2026-08-15T21:01:23.543519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:23.524642Z","title":"Recurrent prediction model for partially observable mdps,","venue":null,"work_id":"d19cb94b-15da-4128-ba0d-4837924f3564","year":2023},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-19T02:52:55.887651Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.677802Z"},"links":{"citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:02d067e86527d0740fbe16f311b6beddf246c72e3ca5051b302ea8981e44ecaa","observation_id":"70c446ac-4926-4f2c-9ad1-327e144ea182","resolution":{"observed_at":"2026-08-15T21:01:23.529450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:23.509825Z","title":"Visualizing transformers for nlp: a brief survey,","venue":null,"work_id":"cfe3c9a7-9789-49ab-8818-58f02f8917d4","year":2020},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-19T02:52:55.887651Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.682088Z"},"links":{"citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:933ee802fb0b484195f4127bdc73131b90949ba6e2bb423dfd5aec33deb9053b","observation_id":"ef5001db-3314-4c8c-b216-d89e3637eeda","resolution":{"observed_at":"2026-08-15T21:01:23.514757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:22.686804Z","title":"Transformers in vision: A survey,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-19T02:52:55.887651Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.686804Z"},"links":{"citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:3956c3300f4c2c30e568b9bb5a02d012663fef8b449acba67369d9f63d044aac","observation_id":"c37841f9-3099-4022-80b6-56f081478351","resolution":{"observed_at":"2026-08-15T21:01:22.686804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:23.486204Z","title":"Windows deep transformer q-networks: an extended variance reduction architecture for partially observable reinforcement learning,","venue":null,"work_id":"fba2fc84-3e59-48e9-9ad7-454c49401e86","year":2024},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-19T02:52:55.887651Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.691129Z"},"links":{"citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:40acfb6f23c96e7724eb637ef4728fb89683a8300970f959f7594be50d69f83d","observation_id":"cc20339b-6200-4c54-9e2d-9b4618c91561","resolution":{"observed_at":"2026-08-15T21:01:23.490794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.01078","last_updated":"2022-11-10T15:04:36Z","snapshot_observed_at":"2026-08-16T16:55:44.376504Z","submitted_at":"2022-06-02T15:04:18Z","title":"Deep Transformer Q-Networks for Partially Observable Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.01078","snapshot_observed_at":"2026-08-15T21:01:22.695510Z","title":"Deep transformer q-networks for partially observable reinforcement learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-19T02:52:55.887651Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.695510Z"},"links":{"cited_paper":"/paper/2206.01078","citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:3d840ce19145f610625890a54bfe2a7a6831680a438c6e0d3e5660f835942d40","observation_id":"c391dc60-aab2-49e3-89ab-0fe39343235a","resolution":{"observed_at":"2026-08-15T21:01:22.695510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1507.06527","last_updated":"2017-01-11T20:25:54Z","snapshot_observed_at":"2026-08-17T11:39:27.847807Z","submitted_at":"2015-07-23T15:16:46Z","title":"Deep Recurrent Q-Learning for Partially Observable MDPs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1507.06527","snapshot_observed_at":"2026-08-15T21:01:22.701126Z","title":"Deep recurrent q-learning for partially observable mdps,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-19T02:52:55.887651Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.701126Z"},"links":{"cited_paper":"/paper/1507.06527","citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:0d6de76d82ecffea9044f615ada580ae53b1a9aa8bf0e336238d4b8bbd8912e9","observation_id":"3888cc66-5364-4345-93f6-9de049e8a60e","resolution":{"observed_at":"2026-08-15T21:01:22.701126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:23.472057Z","title":"On improving deep reinforcement learning for pomdps,","venue":null,"work_id":"2cfcbc3d-c944-4fe9-a702-bd91e9960e44","year":null},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-19T02:52:55.887651Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.705893Z"},"links":{"citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:bc40ab504a228ae20a8a663885aa7e72c350623465f0f3e87b5de74820372707","observation_id":"72a74ba4-3b51-48b8-be89-0bedcb1171fc","resolution":{"observed_at":"2026-08-15T21:01:23.476678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1602.02672","last_updated":"2016-02-08T18:01:35Z","snapshot_observed_at":"2026-08-18T20:20:16.436306Z","submitted_at":"2016-02-08T18:01:35Z","title":"Learning to Communicate to Solve Riddles with Deep Distributed Recurrent Q-Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1602.02672","snapshot_observed_at":"2026-08-15T21:01:22.714601Z","title":"Learning to communicate to solve riddles with deep distributed recurrent q-networks,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-19T02:52:55.887651Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.714601Z"},"links":{"cited_paper":"/paper/1602.02672","citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:b8164a2b6ed79f15aea40972e7acf69884c554c4ebeb02d8e85b96a78fbe5d73","observation_id":"46461b7f-00a1-4fad-b3cd-85734e91a628","resolution":{"observed_at":"2026-08-15T21:01:22.714601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:23.458936Z","title":"Deep reinforcement learning with bidirectional recurrent neural networks for dynamic spectrum access,","venue":null,"work_id":"9366df1d-fa93-4b43-8304-ecd2108f87b2","year":2021},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-19T02:52:55.887651Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.719144Z"},"links":{"citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:c80d4996d3fbc0224b840bde9dc359a09de075ae23b4cecb1fb2db97ee2ac6d6","observation_id":"bf1657e5-c0f3-4a7c-b00d-852e039ba788","resolution":{"observed_at":"2026-08-15T21:01:23.463274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:23.445928Z","title":"On transforming reinforcement learning with transformers: The development trajectory,","venue":null,"work_id":"55cc3de7-94a8-422e-9992-a5f32f939983","year":2024},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-19T02:52:55.887651Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.723470Z"},"links":{"citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:132b4a36a2dd1f99fb0b6e284ffd03a87bb43bd84cf9addfe7327da8680fd823","observation_id":"ae84f17b-566d-4557-b30f-08976440d674","resolution":{"observed_at":"2026-08-15T21:01:23.450134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:23.432672Z","title":"Transformer in reinforcement learning for decision-making: A survey,","venue":null,"work_id":"88f9ed82-0def-4962-9af5-d8d9bca33f13","year":2024},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-19T02:52:55.887651Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.727574Z"},"links":{"citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:3ea26cf596a1ff68da2c103b6a7131e40344f925dee0f0ab2bb636addb102fa9","observation_id":"a562b3df-f1db-4c05-8ff3-3066d67b3fb7","resolution":{"observed_at":"2026-08-15T21:01:23.437267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03762","last_updated":"2023-08-02T00:41:18Z","snapshot_observed_at":"2026-08-19T04:42:40.974785Z","submitted_at":"2017-06-12T17:57:34Z","title":"Attention Is All You Need","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03762","snapshot_observed_at":"2026-08-15T21:01:22.731661Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-19T02:52:55.887651Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.731661Z"},"links":{"cited_paper":"/paper/1706.03762","citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:7477e11bcd87dfa8e1fd561fa4fc8778f42263f4ba4da459b017a83fefaf1b9c","observation_id":"bc4f5edf-f3a8-418b-9dd3-a8428fb3d894","resolution":{"observed_at":"2026-08-15T21:01:22.731661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.01345","last_updated":"2021-06-24T17:09:59Z","snapshot_observed_at":"2026-08-19T12:22:46.459617Z","submitted_at":"2021-06-02T17:53:39Z","title":"Decision Transformer: Reinforcement Learning via Sequence Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.01345","snapshot_observed_at":"2026-08-15T21:01:22.735633Z","title":"Decision transformer: Reinforcement learning via sequence modeling,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-19T02:52:55.887651Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.735633Z"},"links":{"cited_paper":"/paper/2106.01345","citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:3fdb0f2fd5f1a05bd492c54b2bfc908eecf40b45a0b80dcdfdf6a8956566bf3f","observation_id":"dc739bf0-97d2-4002-b7ab-733b2d16428b","resolution":{"observed_at":"2026-08-15T21:01:22.735633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1512.01693","last_updated":"2015-12-05T18:35:40Z","snapshot_observed_at":"2026-08-16T13:29:09.270308Z","submitted_at":"2015-12-05T18:35:40Z","title":"Deep Attention Recurrent Q-Network","version":1},"cited_work":{"arxiv_id":"1512.01693","doi":null,"metadata_source":"pith","pith_arxiv_id":"1512.01693","snapshot_observed_at":"2026-08-15T21:01:23.163920Z","title":"Deep Attention Recurrent Q-Network","venue":"cs.LG","work_id":"ba10646c-0314-4b69-af68-088078a2c420","year":2015},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-19T02:52:55.887651Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.739898Z"},"links":{"cited_paper":"/paper/1512.01693","citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:d60aa4062855499cb90d3684b1a9e4b158cf6b5a2e39997dbb31e60ca8086e90","observation_id":"4cb33299-03b4-4e57-a132-5d852f3352db","resolution":{"observed_at":"2026-08-15T21:01:23.170540Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.02500","last_updated":"2019-06-06T10:02:52Z","snapshot_observed_at":"2026-08-14T16:19:57.327249Z","submitted_at":"2019-06-06T10:02:52Z","title":"Towards Interpretable Reinforcement Learning Using Attention Augmented Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.02500","snapshot_observed_at":"2026-08-15T21:01:22.744141Z","title":"Towards interpretable reinforcement learning using attention augmented agents,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-19T02:52:55.887651Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.744141Z"},"links":{"cited_paper":"/paper/1906.02500","citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:fc5d48e681fccf304136298fea1d7d431530da759cf498087022aa66af56f62c","observation_id":"bdde2bf2-25da-4f13-825a-1a06159bdf88","resolution":{"observed_at":"2026-08-15T21:01:22.744141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01655","last_updated":"2021-04-04T17:56:34Z","snapshot_observed_at":"2026-08-16T18:33:58.039229Z","submitted_at":"2021-04-04T17:56:34Z","title":"Efficient Transformers in Reinforcement Learning using Actor-Learner Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.01655","snapshot_observed_at":"2026-08-15T21:01:22.748705Z","title":"Efficient transformers in reinforcement learning using actor-learner distillation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-19T02:52:55.887651Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.748705Z"},"links":{"cited_paper":"/paper/2104.01655","citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:9a7e66292c401814083132de8f8ed3a62f483817e6a3355a7125b63dc3f7bb32","observation_id":"15e4264b-f93a-4ea3-9c95-268ffa9b797b","resolution":{"observed_at":"2026-08-15T21:01:22.748705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06635","last_updated":"2024-08-27T01:27:29Z","snapshot_observed_at":"2026-08-17T21:47:46.144942Z","submitted_at":"2023-12-11T18:51:59Z","title":"Gated Linear Attention Transformers with Hardware-Efficient Training","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06635","snapshot_observed_at":"2026-08-15T21:01:22.753113Z","title":"Gated linear attention transformers with hardware-efficient training,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-19T02:52:55.887651Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.753113Z"},"links":{"cited_paper":"/paper/2312.06635","citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:c39445666fb3327a4377ce0cdfa36d6d9d87985d5ce2364a41bd2c80bbdc085e","observation_id":"c8c00b89-1879-40dc-97da-39507316d0b6","resolution":{"observed_at":"2026-08-15T21:01:22.753113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:23.418195Z","title":"Offline reinforcement learning as one big sequence modeling problem,","venue":null,"work_id":"3ba46258-4513-47bb-a559-36581783385b","year":2021},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-19T02:52:55.887651Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.757384Z"},"links":{"citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:925db6b4ac4eba750296d169a04d7f6eb4d5ec09dd4bc83f51cf76061717b01f","observation_id":"95495ef3-5df6-49fb-82f3-4c1d5f2e8526","resolution":{"observed_at":"2026-08-15T21:01:23.422707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.05607","last_updated":"2022-07-13T04:21:26Z","snapshot_observed_at":"2026-08-16T17:22:00.419954Z","submitted_at":"2022-02-11T13:43:24Z","title":"Online Decision Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.05607","snapshot_observed_at":"2026-08-15T21:01:22.761745Z","title":"Online decision transformer,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-19T02:52:55.887651Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.761745Z"},"links":{"cited_paper":"/paper/2202.05607","citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:9be8fb885c15ded2043610e1abf68d2f6e1c4197f630c194d5edbfe81deb0ddd","observation_id":"cf540214-cd83-474a-abbf-f3ea2833c154","resolution":{"observed_at":"2026-08-15T21:01:22.761745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03982","last_updated":"2023-11-23T16:02:22Z","snapshot_observed_at":"2026-08-16T15:50:06.398789Z","submitted_at":"2023-03-07T15:32:18Z","title":"Structured State Space Models for In-Context Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03982","snapshot_observed_at":"2026-08-15T21:01:22.766001Z","title":"Structured state space models for in-context reinforcement learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-19T02:52:55.887651Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.766001Z"},"links":{"cited_paper":"/paper/2303.03982","citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:8bda1c7a5bd05f84bfc7e20a08f7d67c6168bc7b9c0628d862706a852af6750d","observation_id":"1d2e5ca5-fe82-49a4-ab95-acd8ef48894f","resolution":{"observed_at":"2026-08-15T21:01:22.766001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04253","last_updated":"2024-03-07T06:35:59Z","snapshot_observed_at":"2026-08-20T02:13:30.643830Z","submitted_at":"2024-03-07T06:35:59Z","title":"Mastering Memory Tasks with World Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04253","snapshot_observed_at":"2026-08-15T21:01:22.770341Z","title":"Mastering memory tasks with world models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-19T02:52:55.887651Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.770341Z"},"links":{"cited_paper":"/paper/2403.04253","citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:2f012d5e7bddd89f33024f49db87cd2b31c7b5ebe25eb6cabf80093fcfc30602","observation_id":"9266ec07-5a79-46c4-9b8d-d0c3732ee6af","resolution":{"observed_at":"2026-08-15T21:01:22.770341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:23.403674Z","title":"Mastering atari with discrete world models,","venue":null,"work_id":"f754141c-6484-4717-bcb9-b213bccb4638","year":null},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-19T02:52:55.887651Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.774501Z"},"links":{"citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:411f2a7a65b37fe2f2739ba9b8cab87680951edc82e65c0438be4c5c581bed7f","observation_id":"53be7564-2bce-4acd-a07d-f7e7840a8e45","resolution":{"observed_at":"2026-08-15T21:01:23.408184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16236","last_updated":"2020-08-31T11:09:32Z","snapshot_observed_at":"2026-08-18T00:51:28.727325Z","submitted_at":"2020-06-29T17:55:38Z","title":"Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16236","snapshot_observed_at":"2026-08-15T21:01:22.783296Z","title":"Transformers are rnns: Fast autoregressive transformers with linear attention,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-19T02:52:55.887651Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.783296Z"},"links":{"cited_paper":"/paper/2006.16236","citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:322287ce9305463f8c05d64231e9a5a5da9da21a4b048edcab2b17a61a1403f0","observation_id":"95412e92-4c5f-4e87-961d-c47b4c45e61f","resolution":{"observed_at":"2026-08-15T21:01:22.783296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13048","last_updated":"2023-12-11T03:58:56Z","snapshot_observed_at":"2026-08-17T17:58:38.402665Z","submitted_at":"2023-05-22T13:57:41Z","title":"RWKV: Reinventing RNNs for the Transformer Era","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13048","snapshot_observed_at":"2026-08-15T21:01:22.787610Z","title":"Rwkv: Reinventing rnns for the transformer era,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-19T02:52:55.887651Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.787610Z"},"links":{"cited_paper":"/paper/2305.13048","citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:9a61a710071175a96b765d8ea979fb2fb9c9fae74fe388b0bf7967a86ece1eca","observation_id":"1fb5fdc0-918f-403d-803b-cb9169442c2c","resolution":{"observed_at":"2026-08-15T21:01:22.787610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.06349","last_updated":"2023-03-11T08:53:11Z","snapshot_observed_at":"2026-08-16T15:49:03.576715Z","submitted_at":"2023-03-11T08:53:11Z","title":"Resurrecting Recurrent Neural Networks for Long Sequences","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.06349","snapshot_observed_at":"2026-08-15T21:01:22.792509Z","title":"Resurrecting recurrent neural networks for long sequences,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-19T02:52:55.887651Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.792509Z"},"links":{"cited_paper":"/paper/2303.06349","citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:8e584be6192d20125a1d10ea804a228d60dc1943e18db84d54405c0d3d3bcb96","observation_id":"c4b344d7-2a02-4d2c-8cbe-5b654b71387a","resolution":{"observed_at":"2026-08-15T21:01:22.792509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:23.389532Z","title":"Efficiently modeling long sequences with structured state spaces,","venue":null,"work_id":"f17ff5fd-c28a-4359-8bba-00dda42181f1","year":null},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-19T02:52:55.887651Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.797991Z"},"links":{"citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:a74590475359f51ff63963ded4509187376842cfb06cc2c661c7139969691c88","observation_id":"16c939f0-da6f-4dd8-88c1-87f85629d068","resolution":{"observed_at":"2026-08-15T21:01:23.394090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.04933","last_updated":"2023-03-03T18:35:28Z","snapshot_observed_at":"2026-08-13T08:14:01.416880Z","submitted_at":"2022-08-09T17:57:43Z","title":"Simplified State Space Layers for Sequence Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.04933","snapshot_observed_at":"2026-08-15T21:01:22.806620Z","title":"Simplified state space layers for sequence modeling,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-19T02:52:55.887651Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.806620Z"},"links":{"cited_paper":"/paper/2208.04933","citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:4a593f64ffa3f4f0e10a306fea23d7299478b17dc56233ec536694f165000850","observation_id":"fec57d69-189a-4b98-b57d-14c3d8f1049d","resolution":{"observed_at":"2026-08-15T21:01:22.806620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.02875","last_updated":"2020-06-23T15:55:05Z","snapshot_observed_at":"2026-08-17T05:48:50.270608Z","submitted_at":"2019-12-05T21:10:08Z","title":"Reinforcement Learning Upside Down: Don't Predict Rewards -- Just Map Them to Actions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.02875","snapshot_observed_at":"2026-08-15T21:01:22.811361Z","title":"Reinforcement learning upside down: Don’t predict rewards – just map them to actions,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-19T02:52:55.887651Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.811361Z"},"links":{"cited_paper":"/paper/1912.02875","citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:b5e4ef73bc96a02f386318ab35e5be4a029e2fbe596c74333085cf5190c3d0fd","observation_id":"28bbaeba-5c66-4e6f-9f28-eae008db609f","resolution":{"observed_at":"2026-08-15T21:01:22.811361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.00396","last_updated":"2022-08-05T17:54:38Z","snapshot_observed_at":"2026-08-14T01:02:41.198730Z","submitted_at":"2021-10-31T03:32:18Z","title":"Efficiently Modeling Long Sequences with Structured State Spaces","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.00396","snapshot_observed_at":"2026-08-15T21:01:22.802215Z","title":"Available: https://arxiv.org/abs/2111.00396","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-19T02:52:55.887651Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.802215Z"},"links":{"cited_paper":"/paper/2111.00396","citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:106178cc6b98f4218e7dd076ebdbae6d0a8c7f13a7e4016c09b9f4851c720887","observation_id":"30d1836c-1d8b-4175-bf0b-aa61e69e536f","resolution":{"observed_at":"2026-08-15T21:01:22.802215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-15T21:01:22.820257Z","title":"Longformer: The long-document transformer,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-19T02:52:55.887651Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.820257Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:db890f172bb6bd32cfa35cfd5f216232e4c9185b981b58cea2a44d28e67944b9","observation_id":"97ea078e-db2f-4e07-a3f1-83beccc4c463","resolution":{"observed_at":"2026-08-15T21:01:22.820257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:23.375911Z","title":"Transformer-XL: Attentive language models beyond a fixed-length context,","venue":null,"work_id":"a7116abd-c1b1-4dc9-968f-01385af6ff01","year":2019},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-19T02:52:55.887651Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.824663Z"},"links":{"citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:337063f17badc9e081ee612487415bbed77767431dd3a69b324eb80eba18ee3f","observation_id":"83ca39f0-2267-4829-b533-4e45e76c6fca","resolution":{"observed_at":"2026-08-15T21:01:23.380533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.06764","last_updated":"2019-10-13T20:02:15Z","snapshot_observed_at":"2026-08-15T16:01:17.783695Z","submitted_at":"2019-10-13T20:02:15Z","title":"Stabilizing Transformers for Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.06764","snapshot_observed_at":"2026-08-15T21:01:22.815814Z","title":"Stabilizing transformers for reinforcement learning,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-19T02:52:55.887651Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.815814Z"},"links":{"cited_paper":"/paper/1910.06764","citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:992173c3e7ff1adae12cf90822547dff43000ab4277ae9d6186209065f14227f","observation_id":"1e28d407-380d-484e-9aca-ba9d95119dfe","resolution":{"observed_at":"2026-08-15T21:01:22.815814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.06881","last_updated":"2022-12-08T12:34:16Z","snapshot_observed_at":"2026-08-20T11:11:37.547865Z","submitted_at":"2022-07-14T13:00:22Z","title":"Recurrent Memory Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.06881","snapshot_observed_at":"2026-08-15T21:01:22.833253Z","title":"Recurrent memory transformer,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-19T02:52:55.887651Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.833253Z"},"links":{"cited_paper":"/paper/2207.06881","citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:994a2a990a25b4fb7d82061b21952dec52c112e9e1e8c73506bc056f553fb464","observation_id":"bfcfe6a5-0e3c-4837-889d-77b8519d1689","resolution":{"observed_at":"2026-08-15T21:01:22.833253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.04451","last_updated":"2020-02-18T16:01:18Z","snapshot_observed_at":"2026-07-06T08:50:12.690900Z","submitted_at":"2020-01-13T18:38:28Z","title":"Reformer: The Efficient Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.04451","snapshot_observed_at":"2026-08-15T21:01:22.837715Z","title":"Reformer: The efficient transformer,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-19T02:52:55.887651Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.837715Z"},"links":{"cited_paper":"/paper/2001.04451","citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:902b9d54fd128856132e5a096ace721e19430a48f26c3245656a579cde71f25a","observation_id":"abedf9b8-7a34-40b0-b995-1881e58d5461","resolution":{"observed_at":"2026-08-15T21:01:22.837715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:23.361878Z","title":"Linear transformers are secretly fast weight programmers,","venue":null,"work_id":"87de3d3e-c41a-411c-a7e5-b14345efe4ee","year":2021},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-19T02:52:55.887651Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.829200Z"},"links":{"citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:35a3f4ff1cc01b57e2fd628fdca3b2ef40c9020ce14200aa78552ceedae9e322","observation_id":"bdddb050-6020-4a30-b036-b7c46fca5a9f","resolution":{"observed_at":"2026-08-15T21:01:23.366622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13297","last_updated":"2023-05-25T17:01:13Z","snapshot_observed_at":"2026-08-16T15:30:58.286344Z","submitted_at":"2023-05-22T17:56:09Z","title":"Investigating the Role of Feed-Forward Networks in Transformers Using Parallel Attention and Feed-Forward Net Design","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13297","snapshot_observed_at":"2026-08-15T21:01:22.846703Z","title":"Investigating the role of feed-forward networks in transformers using parallel attention and feed-forward net design,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-19T02:52:55.887651Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.846703Z"},"links":{"cited_paper":"/paper/2305.13297","citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:c431cdbe8a2aa04a6ae93d6043a23e523ecbabafadc0519fcc58854a347d0d71","observation_id":"c186d155-232d-4e77-ac6e-696a6e491d05","resolution":{"observed_at":"2026-08-15T21:01:22.846703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:23.346602Z","title":"Rethinking transformers in solving pomdps,","venue":null,"work_id":"3d600cbd-9ea7-42f1-af1b-7ac607d0cb2d","year":2024},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-19T02:52:55.887651Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.851223Z"},"links":{"citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:efae309cf595857bdd210fe726381b603931d10bf83dfd6ac1dd6456d78ce124","observation_id":"2057806e-73f7-49fb-943d-4dc4d76b0a5e","resolution":{"observed_at":"2026-08-15T21:01:23.351037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.14794","last_updated":"2022-11-19T12:45:21Z","snapshot_observed_at":"2026-08-12T04:58:34.201421Z","submitted_at":"2020-09-30T17:09:09Z","title":"Rethinking Attention with Performers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.14794","snapshot_observed_at":"2026-08-15T21:01:22.842169Z","title":"Rethinking attention with performers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-19T02:52:55.887651Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.842169Z"},"links":{"cited_paper":"/paper/2009.14794","citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:19817919e1e4d76e465c407143e4213f636d90bcf32ced56217b3d580ef45c86","observation_id":"a7a99566-99ec-4cd8-8365-799994a5d2cb","resolution":{"observed_at":"2026-08-15T21:01:22.842169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:23.317062Z","title":"Pomdp robot domains,","venue":null,"work_id":"5ad79392-a594-4e57-b52d-e1dda5b3081f","year":2021},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-19T02:52:55.887651Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.859622Z"},"links":{"citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:6455668bf586c711a2b2aed624d09075d61ef1d148201c5259d4b8ebed187667","observation_id":"0d42377e-36e6-426d-a376-46d3fb013090","resolution":{"observed_at":"2026-08-15T21:01:23.322069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:23.302287Z","title":"Learning policies for partially observable environments: Scaling up,","venue":null,"work_id":"8527a015-6e13-4926-9992-8ed74e75b599","year":1995},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-19T02:52:55.887651Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.864054Z"},"links":{"citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:9e1396051f2ade8c730396ee6928b2cae6b676292abb2776b58e0ee4625570da","observation_id":"85361ea8-fcb7-41ea-82e3-c8634bc66ce6","resolution":{"observed_at":"2026-08-15T21:01:23.307086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:23.332424Z","title":"gym-gridverse: Gridworld domains for fully and partially observable reinforcement learning,","venue":null,"work_id":"36d64f4e-5e9b-44e6-a45d-18dc90a9a918","year":2021},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-19T02:52:55.887651Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.855486Z"},"links":{"citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:0807623e43c19e1cdb427e62ec5b624e0dbc7624aed4570379df16e2a4834dd2","observation_id":"1f01bb95-6aeb-41f4-8076-af9d547f5e1c","resolution":{"observed_at":"2026-08-15T21:01:23.337172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:23.288084Z","title":"Solving large pomdps using real time dynamic programming,","venue":null,"work_id":"3ea95a31-ff8b-434e-9dfa-a751a760f443","year":1998},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-19T02:52:55.887651Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.868400Z"},"links":{"citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:6868eb510aa5d1ed9bf363f93e3b1c92f6eb50fd8eadbe043ceac83bcb4bc9d1","observation_id":"083fdfd6-0e13-46c0-a7d8-14ce4a391f09","resolution":{"observed_at":"2026-08-15T21:01:23.292669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1704.07978","last_updated":"2018-05-24T14:13:20Z","snapshot_observed_at":"2026-08-14T21:04:41.657382Z","submitted_at":"2017-04-26T05:55:07Z","title":"On Improving Deep Reinforcement Learning for POMDPs","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.07978","snapshot_observed_at":"2026-08-15T21:01:22.710231Z","title":"Available: https://arxiv.org/abs/1704.07978","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-19T02:52:55.887651Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.710231Z"},"links":{"cited_paper":"/paper/1704.07978","citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:c317d31e436824de5b031d0633eae95e390bffdd3889494d5ded3090a8adb99c","observation_id":"1933d1b8-cf1c-4040-9f44-594c111672b1","resolution":{"observed_at":"2026-08-15T21:01:22.710231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02193","last_updated":"2022-02-12T20:01:53Z","snapshot_observed_at":"2026-08-17T02:57:21.304714Z","submitted_at":"2020-10-05T17:52:14Z","title":"Mastering Atari with Discrete World Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02193","snapshot_observed_at":"2026-08-15T21:01:22.778724Z","title":"Available: https://arxiv.org/abs/2010.02193 11","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-19T02:52:55.887651Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.778724Z"},"links":{"cited_paper":"/paper/2010.02193","citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:875dd6614309cb958e80fb77150655f77cf07eed07c1012ccfc8af4835d0c02e","observation_id":"926b6d1d-17ff-4c89-b562-24cb62e6ba2a","resolution":{"observed_at":"2026-08-15T21:01:22.778724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-19T02:52:55.887651Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes"},"reference_resolution":{"displayed":61,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":34,"verified_exact":1,"verified_fuzzy":26},"total_outbound_references":61},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 61 of 61 outbound references and 0 inbound Pith citation observations for arXiv:2505.11153."}