{"as_of":"2026-08-10T09:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1b59b2db3d434fa734b2dec0786449a199ec6c8194fd6bcd3e3e3b4514cb3638","coverage":[{"denominator":30,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:24:27.883078Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-09T23:51:47.724033Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.16864","last_updated":"2025-07-21T21:59:05Z","snapshot_observed_at":"2026-08-07T08:20:45.010409Z","submitted_at":"2025-07-21T21:59:05Z","title":"Reinforcement Learning in hyperbolic space for multi-step reasoning","version":1},"cited_work":{"arxiv_id":"2507.16864","doi":"10.48550/arxiv.2507.16864","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.16864","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement","venue":"ArXiv.org","work_id":"1639c77f-7d05-4067-82c2-01cb4e9d9164","year":null},"citing_paper":{"arxiv_id":"2604.21027","last_updated":"2026-08-02T16:15:42Z","snapshot_observed_at":"2026-08-06T23:24:26.820832Z","submitted_at":"2026-04-22T19:18:36Z","title":"HypEHR: Hyperbolic Modeling of Electronic Health Records for Efficient Question Answering","version":1},"reference_index":118,"source":"arxiv_source","source_observed_at":"2026-05-09T23:51:47.724033Z"},"links":{"cited_paper":"/paper/2507.16864","citing_paper":"/paper/2604.21027"},"observation_digest":"sha256:90f2fb86d4a00c028b706d719795f12072d1d2bb1af3fd6a5d32d53acb36e838","observation_id":"d5b84770-5e8f-45f9-bf6d-9cdc8a10a36d","resolution":{"observed_at":"2026-05-09T23:54:45.604319Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.16864/citation-record","integrity":"/paper/2507.16864/integrity","json":"/paper/2507.16864/citation-record.json","paper":"/paper/2507.16864"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.03671","last_updated":"2025-05-28T05:08:18Z","snapshot_observed_at":"2026-08-09T04:05:53.287064Z","submitted_at":"2025-02-05T23:31:39Z","title":"Advancing Reasoning in Large Language Models: Promising Methods and Approaches","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03671","snapshot_observed_at":"2026-08-06T15:24:25.191374Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.16864","last_updated":"2025-07-21T21:59:05Z","snapshot_observed_at":"2026-08-07T08:20:45.010409Z","submitted_at":"2025-07-21T21:59:05Z","title":"Reinforcement Learning in hyperbolic space for multi-step reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T15:24:25.191374Z"},"links":{"cited_paper":"/paper/2502.03671","citing_paper":"/paper/2507.16864"},"observation_digest":"sha256:dca5e6aa59708704ea573a92e056657d948ff295fe4559cd88219e1e4d94f334","observation_id":"9f291b92-9ff4-42fc-892d-ecaf5592c824","resolution":{"observed_at":"2026-08-06T15:24:25.191374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:24:30.711285Z","title":null,"venue":null,"work_id":"f2b1604b-2cb7-46ec-9a41-dffe480b07e8","year":2015},"citing_paper":{"arxiv_id":"2507.16864","last_updated":"2025-07-21T21:59:05Z","snapshot_observed_at":"2026-08-07T08:20:45.010409Z","submitted_at":"2025-07-21T21:59:05Z","title":"Reinforcement Learning in hyperbolic space for multi-step reasoning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T15:24:25.289751Z"},"links":{"citing_paper":"/paper/2507.16864"},"observation_digest":"sha256:6d9bc5cf6fbab93fec434a344d732d664259ff0ee4cf2b8b057d07f43e9e3dbc","observation_id":"e791a1a2-9549-4505-a103-4353d0e036f4","resolution":{"observed_at":"2026-08-06T15:24:30.736509Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:24:30.565562Z","title":null,"venue":null,"work_id":"d087057c-1fe4-40d1-86f3-b297840386f2","year":2025},"citing_paper":{"arxiv_id":"2507.16864","last_updated":"2025-07-21T21:59:05Z","snapshot_observed_at":"2026-08-07T08:20:45.010409Z","submitted_at":"2025-07-21T21:59:05Z","title":"Reinforcement Learning in hyperbolic space for multi-step reasoning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T15:24:25.385382Z"},"links":{"citing_paper":"/paper/2507.16864"},"observation_digest":"sha256:56392f4ddc653ce98af3f43c32e186d151b9ce6684b0c0f1e339149240f1f4a6","observation_id":"413e08c6-4fc0-45ed-8c58-1983936e23ed","resolution":{"observed_at":"2026-08-06T15:24:30.656103Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:24:30.412818Z","title":"Multi-step reinforcement learning: A unifying algorithm","venue":null,"work_id":"2db0f98e-adfa-46c7-a490-25a9ea34531a","year":2018},"citing_paper":{"arxiv_id":"2507.16864","last_updated":"2025-07-21T21:59:05Z","snapshot_observed_at":"2026-08-07T08:20:45.010409Z","submitted_at":"2025-07-21T21:59:05Z","title":"Reinforcement Learning in hyperbolic space for multi-step reasoning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T15:24:25.600915Z"},"links":{"citing_paper":"/paper/2507.16864"},"observation_digest":"sha256:95dd50da8c9ae4909770ce12ec782788113e6c8120f05bbcdca7e284c0cd743c","observation_id":"03a384d6-6603-4d12-a5ca-d098dad036e3","resolution":{"observed_at":"2026-08-06T15:24:30.474757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-06T15:24:25.721846Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16864","last_updated":"2025-07-21T21:59:05Z","snapshot_observed_at":"2026-08-07T08:20:45.010409Z","submitted_at":"2025-07-21T21:59:05Z","title":"Reinforcement Learning in hyperbolic space for multi-step reasoning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T15:24:25.721846Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2507.16864"},"observation_digest":"sha256:c8238e2908f416e3fd2ff50cb92ad7d86bb0e41bf6d994545f96d16183cd2150","observation_id":"6da6aa9e-b692-4407-a50d-263863717101","resolution":{"observed_at":"2026-08-06T15:24:25.721846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01715","last_updated":"2025-02-03T16:22:06Z","snapshot_observed_at":"2026-08-09T18:06:48.458050Z","submitted_at":"2025-02-03T16:22:06Z","title":"Process-Supervised Reinforcement Learning for Code Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01715","snapshot_observed_at":"2026-08-06T15:24:25.819837Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.16864","last_updated":"2025-07-21T21:59:05Z","snapshot_observed_at":"2026-08-07T08:20:45.010409Z","submitted_at":"2025-07-21T21:59:05Z","title":"Reinforcement Learning in hyperbolic space for multi-step reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T15:24:25.819837Z"},"links":{"cited_paper":"/paper/2502.01715","citing_paper":"/paper/2507.16864"},"observation_digest":"sha256:12d30339e6eaac91e43eccc00e972900a74b7d6f836ecde3c59b2a5e78b95f02","observation_id":"aaffbf05-6329-479d-bf10-f10098639611","resolution":{"observed_at":"2026-08-06T15:24:25.819837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07866","last_updated":"2025-08-13T04:59:17Z","snapshot_observed_at":"2026-08-02T10:27:50.379804Z","submitted_at":"2024-10-10T12:34:25Z","title":"System 2 Reasoning for Human-AI Alignment: Generality and Adaptivity via ARC-AGI","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07866","snapshot_observed_at":"2026-08-06T15:24:25.874748Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16864","last_updated":"2025-07-21T21:59:05Z","snapshot_observed_at":"2026-08-07T08:20:45.010409Z","submitted_at":"2025-07-21T21:59:05Z","title":"Reinforcement Learning in hyperbolic space for multi-step reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T15:24:25.874748Z"},"links":{"cited_paper":"/paper/2410.07866","citing_paper":"/paper/2507.16864"},"observation_digest":"sha256:550811bba6a375a699c0f93f11b2f46db96345b6d9aa90b538543bf089de500b","observation_id":"6c9a4a8c-d07e-4988-a050-86cb06ce2e57","resolution":{"observed_at":"2026-08-06T15:24:25.874748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14082","last_updated":"2024-08-23T23:02:28Z","snapshot_observed_at":"2026-07-06T18:03:38.397804Z","submitted_at":"2024-04-22T11:01:51Z","title":"Mechanistic Interpretability for AI Safety -- A Review","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14082","snapshot_observed_at":"2026-08-06T15:24:25.984891Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16864","last_updated":"2025-07-21T21:59:05Z","snapshot_observed_at":"2026-08-07T08:20:45.010409Z","submitted_at":"2025-07-21T21:59:05Z","title":"Reinforcement Learning in hyperbolic space for multi-step reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T15:24:25.984891Z"},"links":{"cited_paper":"/paper/2404.14082","citing_paper":"/paper/2507.16864"},"observation_digest":"sha256:38068119c6141b8040a9c08260e2f74ff3b943592b67536a1eb7dd77392fbb43","observation_id":"47f297f6-ad03-4245-9655-2cd4e3090e17","resolution":{"observed_at":"2026-08-06T15:24:25.984891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.05979","last_updated":"2023-07-12T07:51:12Z","snapshot_observed_at":"2026-07-06T15:53:07.429379Z","submitted_at":"2023-07-12T07:51:12Z","title":"Transformers in Reinforcement Learning: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.05979","snapshot_observed_at":"2026-08-06T15:24:26.050901Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.16864","last_updated":"2025-07-21T21:59:05Z","snapshot_observed_at":"2026-08-07T08:20:45.010409Z","submitted_at":"2025-07-21T21:59:05Z","title":"Reinforcement Learning in hyperbolic space for multi-step reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T15:24:26.050901Z"},"links":{"cited_paper":"/paper/2307.05979","citing_paper":"/paper/2507.16864"},"observation_digest":"sha256:f4a04a942051683ca8772facc7c1b435eb879311887fdd4f8ebd4a3c2ffd6197","observation_id":"0356ed62-c5dd-4f6b-91f6-952dee763cc6","resolution":{"observed_at":"2026-08-06T15:24:26.050901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.03044","last_updated":"2023-09-20T21:12:31Z","snapshot_observed_at":"2026-08-10T00:11:40.769751Z","submitted_at":"2023-01-08T14:04:26Z","title":"A Survey on Transformers in Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.03044","snapshot_observed_at":"2026-08-06T15:24:26.139099Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.16864","last_updated":"2025-07-21T21:59:05Z","snapshot_observed_at":"2026-08-07T08:20:45.010409Z","submitted_at":"2025-07-21T21:59:05Z","title":"Reinforcement Learning in hyperbolic space for multi-step reasoning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T15:24:26.139099Z"},"links":{"cited_paper":"/paper/2301.03044","citing_paper":"/paper/2507.16864"},"observation_digest":"sha256:3835962efee3ae824ad6837566e4eaf3377134bc59412aee2ac57090dd5a1740","observation_id":"5700f723-f5e9-4840-b5d7-8340f3c30fef","resolution":{"observed_at":"2026-08-06T15:24:26.139099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.01078","last_updated":"2022-11-10T15:04:36Z","snapshot_observed_at":"2026-07-06T13:16:50.653039Z","submitted_at":"2022-06-02T15:04:18Z","title":"Deep Transformer Q-Networks for Partially Observable Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.01078","snapshot_observed_at":"2026-08-06T15:24:26.214913Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.16864","last_updated":"2025-07-21T21:59:05Z","snapshot_observed_at":"2026-08-07T08:20:45.010409Z","submitted_at":"2025-07-21T21:59:05Z","title":"Reinforcement Learning in hyperbolic space for multi-step reasoning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T15:24:26.214913Z"},"links":{"cited_paper":"/paper/2206.01078","citing_paper":"/paper/2507.16864"},"observation_digest":"sha256:9a5c7b1446b7feaa6beb33bf5b057a2a3251a1b570ddae1cb6b8e3cf9671a524","observation_id":"3fbb0660-e539-4f30-93da-fcf734f3e99a","resolution":{"observed_at":"2026-08-06T15:24:26.214913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:24:30.253579Z","title":null,"venue":null,"work_id":"03604ccd-8ef5-4740-87f0-e779f735c131","year":2003},"citing_paper":{"arxiv_id":"2507.16864","last_updated":"2025-07-21T21:59:05Z","snapshot_observed_at":"2026-08-07T08:20:45.010409Z","submitted_at":"2025-07-21T21:59:05Z","title":"Reinforcement Learning in hyperbolic space for multi-step reasoning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T15:24:26.312548Z"},"links":{"citing_paper":"/paper/2507.16864"},"observation_digest":"sha256:90521b00fedab68f99f7803a2f6d715c4c7418e0a9ec2b737bf0762b10cb0761","observation_id":"ae8e3e84-d7d0-42fe-886a-3e73e6e824f5","resolution":{"observed_at":"2026-08-06T15:24:30.322606Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.09481","last_updated":"2024-11-19T16:55:55Z","snapshot_observed_at":"2026-08-07T03:30:45.524834Z","submitted_at":"2022-02-19T00:30:52Z","title":"TransDreamer: Reinforcement Learning with Transformer World Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.09481","snapshot_observed_at":"2026-08-06T15:24:26.376531Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.16864","last_updated":"2025-07-21T21:59:05Z","snapshot_observed_at":"2026-08-07T08:20:45.010409Z","submitted_at":"2025-07-21T21:59:05Z","title":"Reinforcement Learning in hyperbolic space for multi-step reasoning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T15:24:26.376531Z"},"links":{"cited_paper":"/paper/2202.09481","citing_paper":"/paper/2507.16864"},"observation_digest":"sha256:7db385807eca33796aa35b009640ed1ce5c874211e2907be891100b3b66eecda","observation_id":"3febb1cf-f523-4cb9-8de8-7d08acdfd19c","resolution":{"observed_at":"2026-08-06T15:24:26.376531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:24:30.105138Z","title":null,"venue":null,"work_id":"c6d57929-1375-4090-b956-0456d5637180","year":2017},"citing_paper":{"arxiv_id":"2507.16864","last_updated":"2025-07-21T21:59:05Z","snapshot_observed_at":"2026-08-07T08:20:45.010409Z","submitted_at":"2025-07-21T21:59:05Z","title":"Reinforcement Learning in hyperbolic space for multi-step reasoning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T15:24:26.447389Z"},"links":{"citing_paper":"/paper/2507.16864"},"observation_digest":"sha256:d61cc37e478d15e49222adeeb09709d7b4763c90871f1a9236545a95a099d205","observation_id":"9f2d7c5d-0f5e-4bcf-94f6-8b4c9700e7ec","resolution":{"observed_at":"2026-08-06T15:24:30.170128Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:24:29.940227Z","title":null,"venue":null,"work_id":"b902f680-12b0-4395-a897-3624353ad8cb","year":2018},"citing_paper":{"arxiv_id":"2507.16864","last_updated":"2025-07-21T21:59:05Z","snapshot_observed_at":"2026-08-07T08:20:45.010409Z","submitted_at":"2025-07-21T21:59:05Z","title":"Reinforcement Learning in hyperbolic space for multi-step reasoning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T15:24:26.491830Z"},"links":{"citing_paper":"/paper/2507.16864"},"observation_digest":"sha256:14e3715b2555cba8e10f497dafb1e1cb177655bf61f863a3f1d6f6f244c73274","observation_id":"3a5f4cac-de24-471d-8db3-3581bef3df7d","resolution":{"observed_at":"2026-08-06T15:24:30.007428Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15302","last_updated":"2025-09-09T02:51:58Z","snapshot_observed_at":"2026-07-06T18:19:08.871953Z","submitted_at":"2024-05-24T07:41:26Z","title":"Understanding the Language Model to Solve the Symbolic Multi-Step Reasoning Problem from the Perspective of Buffer Mechanism","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15302","snapshot_observed_at":"2026-08-06T15:24:26.585807Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16864","last_updated":"2025-07-21T21:59:05Z","snapshot_observed_at":"2026-08-07T08:20:45.010409Z","submitted_at":"2025-07-21T21:59:05Z","title":"Reinforcement Learning in hyperbolic space for multi-step reasoning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T15:24:26.585807Z"},"links":{"cited_paper":"/paper/2405.15302","citing_paper":"/paper/2507.16864"},"observation_digest":"sha256:398ab8b1b0b4c6ea59926a7f1846c165fba2d34c71bdd8dc76ac97cba1e0a4c0","observation_id":"a906c0a1-69e0-4378-930d-5c71a3242d7a","resolution":{"observed_at":"2026-08-06T15:24:26.585807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09302","last_updated":"2025-02-11T01:46:35Z","snapshot_observed_at":"2026-07-06T19:32:10.826706Z","submitted_at":"2024-10-11T23:29:20Z","title":"Enhancing Multi-Step Reasoning Abilities of Language Models through Direct Q-Function Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.09302","snapshot_observed_at":"2026-08-06T15:24:26.666597Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16864","last_updated":"2025-07-21T21:59:05Z","snapshot_observed_at":"2026-08-07T08:20:45.010409Z","submitted_at":"2025-07-21T21:59:05Z","title":"Reinforcement Learning in hyperbolic space for multi-step reasoning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T15:24:26.666597Z"},"links":{"cited_paper":"/paper/2410.09302","citing_paper":"/paper/2507.16864"},"observation_digest":"sha256:4fc5a2668691d9279c320877589e44039b1a9fecc073297e0c2c6de79b3baf0b","observation_id":"b41e75c3-aeea-4c77-91fd-e1d67ff4f3eb","resolution":{"observed_at":"2026-08-06T15:24:26.666597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:24:29.769003Z","title":null,"venue":null,"work_id":"fa6a7781-63f0-4000-8a42-d27d49667691","year":2025},"citing_paper":{"arxiv_id":"2507.16864","last_updated":"2025-07-21T21:59:05Z","snapshot_observed_at":"2026-08-07T08:20:45.010409Z","submitted_at":"2025-07-21T21:59:05Z","title":"Reinforcement Learning in hyperbolic space for multi-step reasoning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T15:24:26.793498Z"},"links":{"citing_paper":"/paper/2507.16864"},"observation_digest":"sha256:62170b13d936455ae336ecc7c390dccf5d734ee2b07f1cd3a04fc42f5cf35e0c","observation_id":"de208ac0-a99d-4c4e-9d92-bd2b09d0416c","resolution":{"observed_at":"2026-08-06T15:24:29.852764Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:24:29.620479Z","title":null,"venue":null,"work_id":"79ef4211-3934-4196-b5e0-c9b804c2e6ba","year":2024},"citing_paper":{"arxiv_id":"2507.16864","last_updated":"2025-07-21T21:59:05Z","snapshot_observed_at":"2026-08-07T08:20:45.010409Z","submitted_at":"2025-07-21T21:59:05Z","title":"Reinforcement Learning in hyperbolic space for multi-step reasoning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T15:24:26.889102Z"},"links":{"citing_paper":"/paper/2507.16864"},"observation_digest":"sha256:37c743c51a0c84aaf1b7e85aa46e2353cc60e2dd0d88cde2ce325efcea11c77e","observation_id":"f0e5f976-146d-40fe-9e6a-ced587c64e51","resolution":{"observed_at":"2026-08-06T15:24:29.689007Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:24:29.480859Z","title":null,"venue":null,"work_id":"5b795e75-46a9-4400-8f37-055aab523fff","year":2021},"citing_paper":{"arxiv_id":"2507.16864","last_updated":"2025-07-21T21:59:05Z","snapshot_observed_at":"2026-08-07T08:20:45.010409Z","submitted_at":"2025-07-21T21:59:05Z","title":"Reinforcement Learning in hyperbolic space for multi-step reasoning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T15:24:26.986934Z"},"links":{"citing_paper":"/paper/2507.16864"},"observation_digest":"sha256:80cd64f86d2d6026b363bbd6eccb7930a128f12ee3d32080c797832eb49dde00","observation_id":"efb3d764-7090-4e84-8a54-65a4ec6c0b1c","resolution":{"observed_at":"2026-08-06T15:24:29.547578Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:24:29.319038Z","title":null,"venue":null,"work_id":"b57b283b-c484-4138-b72d-b42ff67d3972","year":2020},"citing_paper":{"arxiv_id":"2507.16864","last_updated":"2025-07-21T21:59:05Z","snapshot_observed_at":"2026-08-07T08:20:45.010409Z","submitted_at":"2025-07-21T21:59:05Z","title":"Reinforcement Learning in hyperbolic space for multi-step reasoning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T15:24:27.052694Z"},"links":{"citing_paper":"/paper/2507.16864"},"observation_digest":"sha256:3ce20c61d3240ad49048398c535e8d517c279552f842cd823489f102e93f6f35","observation_id":"8cc50101-0e0b-45a8-81f1-4a2740de302c","resolution":{"observed_at":"2026-08-06T15:24:29.386796Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.06546","last_updated":"2018-11-22T15:46:17Z","snapshot_observed_at":"2026-07-06T07:08:12.503941Z","submitted_at":"2018-10-15T17:54:36Z","title":"Poincar\\'e GloVe: Hyperbolic Word Embeddings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.06546","snapshot_observed_at":"2026-08-06T15:24:27.151997Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.16864","last_updated":"2025-07-21T21:59:05Z","snapshot_observed_at":"2026-08-07T08:20:45.010409Z","submitted_at":"2025-07-21T21:59:05Z","title":"Reinforcement Learning in hyperbolic space for multi-step reasoning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T15:24:27.151997Z"},"links":{"cited_paper":"/paper/1810.06546","citing_paper":"/paper/2507.16864"},"observation_digest":"sha256:b875a993dc7f1ba6dfb555661a6a53eb456b50ec701210ab3c41313ddea252d2","observation_id":"ee9628fd-abe5-4c13-92e9-51b449639072","resolution":{"observed_at":"2026-08-06T15:24:27.151997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:24:29.152051Z","title":null,"venue":null,"work_id":"3ec8fa2c-5fc5-4b5f-a0cb-2316313867de","year":2018},"citing_paper":{"arxiv_id":"2507.16864","last_updated":"2025-07-21T21:59:05Z","snapshot_observed_at":"2026-08-07T08:20:45.010409Z","submitted_at":"2025-07-21T21:59:05Z","title":"Reinforcement Learning in hyperbolic space for multi-step reasoning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T15:24:27.220722Z"},"links":{"citing_paper":"/paper/2507.16864"},"observation_digest":"sha256:9f34ec3adfd83730dac73ba1efe374135b7fd03999b6d3ba7356c28897228303","observation_id":"86128f63-7e99-4d89-b410-f9c31ad43f95","resolution":{"observed_at":"2026-08-06T15:24:29.249154Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07864","last_updated":"2025-06-12T11:45:57Z","snapshot_observed_at":"2026-08-08T11:39:25.654067Z","submitted_at":"2025-02-11T18:20:18Z","title":"TransMLA: Multi-Head Latent Attention Is All You Need","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07864","snapshot_observed_at":"2026-08-06T15:24:27.310795Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.16864","last_updated":"2025-07-21T21:59:05Z","snapshot_observed_at":"2026-08-07T08:20:45.010409Z","submitted_at":"2025-07-21T21:59:05Z","title":"Reinforcement Learning in hyperbolic space for multi-step reasoning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T15:24:27.310795Z"},"links":{"cited_paper":"/paper/2502.07864","citing_paper":"/paper/2507.16864"},"observation_digest":"sha256:bb673e2129357bd9847a70f27748726afc27486b68c55c3f8474f73b8c49d7c6","observation_id":"19b80823-8346-4964-95f5-fd171b1c823b","resolution":{"observed_at":"2026-08-06T15:24:27.310795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:24:28.968461Z","title":null,"venue":null,"work_id":"e31ed68f-cf4d-4bb3-8668-b192e5543e16","year":2024},"citing_paper":{"arxiv_id":"2507.16864","last_updated":"2025-07-21T21:59:05Z","snapshot_observed_at":"2026-08-07T08:20:45.010409Z","submitted_at":"2025-07-21T21:59:05Z","title":"Reinforcement Learning in hyperbolic space for multi-step reasoning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T15:24:27.405059Z"},"links":{"citing_paper":"/paper/2507.16864"},"observation_digest":"sha256:6c8a7886fe47137adc06562dd3b9ee93ec2334dc3dafe82a51d8766ef4624368","observation_id":"c910248f-3e95-48f7-b327-122eeb0e90bb","resolution":{"observed_at":"2026-08-06T15:24:29.068005Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:24:28.810169Z","title":null,"venue":null,"work_id":"1876364b-7325-474f-aaa4-e4a0fb83d4dc","year":2025},"citing_paper":{"arxiv_id":"2507.16864","last_updated":"2025-07-21T21:59:05Z","snapshot_observed_at":"2026-08-07T08:20:45.010409Z","submitted_at":"2025-07-21T21:59:05Z","title":"Reinforcement Learning in hyperbolic space for multi-step reasoning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T15:24:27.511247Z"},"links":{"citing_paper":"/paper/2507.16864"},"observation_digest":"sha256:289cb536133f77f5e4de62b677b5430d46918b9afc738c45cfcaaf406c12503c","observation_id":"0fd0795c-86f6-41e1-b087-1f98c1a8ac92","resolution":{"observed_at":"2026-08-06T15:24:28.881615Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:24:28.647848Z","title":null,"venue":null,"work_id":"ceddcf43-4a06-4775-893b-77e69dc47c50","year":2024},"citing_paper":{"arxiv_id":"2507.16864","last_updated":"2025-07-21T21:59:05Z","snapshot_observed_at":"2026-08-07T08:20:45.010409Z","submitted_at":"2025-07-21T21:59:05Z","title":"Reinforcement Learning in hyperbolic space for multi-step reasoning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T15:24:27.637964Z"},"links":{"citing_paper":"/paper/2507.16864"},"observation_digest":"sha256:4255c4c700f8af0b03ca6aecbcaa838d179dbab38cf06b0797f9dd7dd77b3d7e","observation_id":"cf8a0260-50bd-43bf-a72c-03e63185ed2c","resolution":{"observed_at":"2026-08-06T15:24:28.715723Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16145","last_updated":"2024-12-25T18:54:02Z","snapshot_observed_at":"2026-07-06T20:11:06.248415Z","submitted_at":"2024-12-20T18:49:45Z","title":"Offline Reinforcement Learning for LLM Multi-Step Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16145","snapshot_observed_at":"2026-08-06T15:24:27.704354Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16864","last_updated":"2025-07-21T21:59:05Z","snapshot_observed_at":"2026-08-07T08:20:45.010409Z","submitted_at":"2025-07-21T21:59:05Z","title":"Reinforcement Learning in hyperbolic space for multi-step reasoning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T15:24:27.704354Z"},"links":{"cited_paper":"/paper/2412.16145","citing_paper":"/paper/2507.16864"},"observation_digest":"sha256:89713ad0728c1d9d5fee9001b2ad84581cd84846c6b6daf8e7aadaa1a182d268","observation_id":"7e0152b2-7e3e-4348-be31-8bd04f407e02","resolution":{"observed_at":"2026-08-06T15:24:27.704354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.05979","last_updated":"2023-07-12T07:51:12Z","snapshot_observed_at":"2026-07-06T15:53:07.429379Z","submitted_at":"2023-07-12T07:51:12Z","title":"Transformers in Reinforcement Learning: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.05979","snapshot_observed_at":"2026-08-06T15:24:27.790125Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.16864","last_updated":"2025-07-21T21:59:05Z","snapshot_observed_at":"2026-08-07T08:20:45.010409Z","submitted_at":"2025-07-21T21:59:05Z","title":"Reinforcement Learning in hyperbolic space for multi-step reasoning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T15:24:27.790125Z"},"links":{"cited_paper":"/paper/2307.05979","citing_paper":"/paper/2507.16864"},"observation_digest":"sha256:9bd1471e9524ce86c6c849f5243165600b74db3c4773076e0054492dffbab803","observation_id":"3495c8fb-34ed-46ca-86e3-adfeb0792238","resolution":{"observed_at":"2026-08-06T15:24:27.790125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:24:28.455809Z","title":null,"venue":null,"work_id":"a67ed0d5-f210-456a-a966-ffbbb1cac1cb","year":2023},"citing_paper":{"arxiv_id":"2507.16864","last_updated":"2025-07-21T21:59:05Z","snapshot_observed_at":"2026-08-07T08:20:45.010409Z","submitted_at":"2025-07-21T21:59:05Z","title":"Reinforcement Learning in hyperbolic space for multi-step reasoning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T15:24:27.883078Z"},"links":{"citing_paper":"/paper/2507.16864"},"observation_digest":"sha256:35d3b3d6e9dd88dd359c462b24723b972a7b2d5a1c18300ea8abdd3f86ae9c10","observation_id":"5e63b8d5-7ed3-4a55-99b9-9c3cde6264ca","resolution":{"observed_at":"2026-08-06T15:24:28.562546Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.16864","last_updated":"2025-07-21T21:59:05Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T08:20:45.010409Z","submitted_at":"2025-07-21T21:59:05Z","title":"Reinforcement Learning in hyperbolic space for multi-step reasoning"},"reference_resolution":{"displayed":30,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":0,"verified_fuzzy":1},"total_outbound_references":30},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 30 of 30 outbound references and 1 inbound Pith citation observation for arXiv:2507.16864."}