{"as_of":"2026-08-23T06:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c77850ef7e993f15d04bd4abe599836ab92a9fb569faebd4d550103973c57af9","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":40,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T12:02:42.907988Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T21:28:58.240235Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","snapshot_observed_at":"2026-08-16T19:00:31.865937Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing","version":1},"cited_work":{"arxiv_id":"2503.10639","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10639","snapshot_observed_at":"2026-07-03T21:28:58.240235Z","title":"arXiv preprint arXiv:2503.10639 , year=","venue":null,"work_id":"685a5109-0d26-4c27-8c5e-c8ee1c75f197","year":2025},"citing_paper":{"arxiv_id":"2503.12605","last_updated":"2025-03-23T13:47:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-16T18:39:13Z","title":"Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey","version":2},"reference_index":255,"source":"pdf_text","source_observed_at":"2026-05-15T17:18:52.996467Z"},"links":{"cited_paper":"/paper/2503.10639","citing_paper":"/paper/2503.12605"},"observation_digest":"sha256:96cd07fa06469f424bbfd22ac83f19233792d264f8aac765eb74f4b54fa5734c","observation_id":"43cde051-d7e4-4926-8375-5a61830f08ec","resolution":{"observed_at":"2026-05-15T17:18:53.577665Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","snapshot_observed_at":"2026-08-16T19:00:31.865937Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10639","snapshot_observed_at":"2026-08-16T12:02:42.907988Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.13828","last_updated":"2025-04-28T12:41:07Z","snapshot_observed_at":"2026-08-18T03:47:57.203659Z","submitted_at":"2025-04-18T17:55:58Z","title":"Generative AI Act II: Test Time Scaling Drives Cognition Engineering","version":3},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-16T12:02:42.907988Z"},"links":{"cited_paper":"/paper/2503.10639","citing_paper":"/paper/2504.13828"},"observation_digest":"sha256:d8855485529c67ec7abe35f9d4ecec5422179e8831172e79c3c02ac368d8dbc6","observation_id":"a311df4b-048b-46b2-b3fa-fad1dae13097","resolution":{"observed_at":"2026-08-16T12:02:42.907988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","snapshot_observed_at":"2026-08-16T19:00:31.865937Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing","version":1},"cited_work":{"arxiv_id":"2503.10639","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10639","snapshot_observed_at":"2026-07-03T21:28:58.240235Z","title":"arXiv preprint arXiv:2503.10639 , year=","venue":null,"work_id":"685a5109-0d26-4c27-8c5e-c8ee1c75f197","year":2025},"citing_paper":{"arxiv_id":"2504.17761","last_updated":"2025-07-31T05:05:45Z","snapshot_observed_at":"2026-08-15T10:26:22.896514Z","submitted_at":"2025-04-24T17:25:12Z","title":"Step1X-Edit: A Practical Framework for General Image Editing","version":5},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-11T14:36:41.467429Z"},"links":{"cited_paper":"/paper/2503.10639","citing_paper":"/paper/2504.17761"},"observation_digest":"sha256:6a9f4f0d9e9e70cf8bd1996ed3018be18cd876a14a3e7289f8e4421313cff8e7","observation_id":"05e16346-56ee-4424-8657-735ad92e1cc8","resolution":{"observed_at":"2026-05-11T14:36:41.949615Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","snapshot_observed_at":"2026-08-16T19:00:31.865937Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10639","snapshot_observed_at":"2026-08-16T04:21:03.804768Z","title":"Got: Un- leashing reasoning capability of multimodal large language model for visual generation and editing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.01490","last_updated":"2025-05-02T17:59:06Z","snapshot_observed_at":"2026-08-20T11:46:20.426568Z","submitted_at":"2025-05-02T17:59:06Z","title":"WorldGenBench: A World-Knowledge-Integrated Benchmark for Reasoning-Driven Text-to-Image Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T04:21:03.804768Z"},"links":{"cited_paper":"/paper/2503.10639","citing_paper":"/paper/2505.01490"},"observation_digest":"sha256:3fca53622156773e4beaadae02450bc5ff1e9d8308268450c0235ef1bc6f30c3","observation_id":"2d10fbf6-fa10-4d28-8599-c33d4693be75","resolution":{"observed_at":"2026-08-16T04:21:03.804768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","snapshot_observed_at":"2026-08-16T19:00:31.865937Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10639","snapshot_observed_at":"2026-08-15T20:26:58.139315Z","title":"arXiv preprint arXiv:2503.10639 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-17T23:10:01.694062Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T20:26:58.139315Z"},"links":{"cited_paper":"/paper/2503.10639","citing_paper":"/paper/2505.13031"},"observation_digest":"sha256:75c8f5e5a2861de4a535f2ef6e311a16df063ffbcfc9fdd1aa4be3c634d72a94","observation_id":"71cab7d0-ea13-4b25-88de-9852fedef3cd","resolution":{"observed_at":"2026-08-15T20:26:58.139315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","snapshot_observed_at":"2026-08-16T19:00:31.865937Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10639","snapshot_observed_at":"2026-08-07T15:34:52.941000Z","title":"Got: Unleashing reasoning capability of multimodal large language model for visual generation and editing.arXiv:2503.10639, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:52.941000Z"},"links":{"cited_paper":"/paper/2503.10639","citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:6712974d3170a74433bcef3ea6b544a5f8d0d9f32bcf461686c3bd12f7679677","observation_id":"bb2098e1-9e53-41ce-a64b-85e74d3182cd","resolution":{"observed_at":"2026-08-07T15:34:52.941000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","snapshot_observed_at":"2026-08-16T19:00:31.865937Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10639","snapshot_observed_at":"2026-08-07T15:02:16.805570Z","title":"Got: Unleashing reasoning capability of multimodal large language model for visual generation and editing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16707","last_updated":"2025-05-22T14:08:59Z","snapshot_observed_at":"2026-08-14T15:32:44.875708Z","submitted_at":"2025-05-22T14:08:59Z","title":"KRIS-Bench: Benchmarking Next-Level Intelligent Image Editing Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:16.805570Z"},"links":{"cited_paper":"/paper/2503.10639","citing_paper":"/paper/2505.16707"},"observation_digest":"sha256:7af40c21c1a2e11b4cf37053ecc56aaea186a25ea996177b99982ff7c4da6382","observation_id":"2a0928ba-56dc-4f6e-a987-3068b786be3e","resolution":{"observed_at":"2026-08-07T15:02:16.805570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","snapshot_observed_at":"2026-08-16T19:00:31.865937Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10639","snapshot_observed_at":"2026-08-07T14:46:34.827824Z","title":"Got: Unleashing reasoning capability of multimodal large language model for visual generation and editing.arXiv preprint arXiv:2503.10639, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17768","last_updated":"2025-07-20T01:08:18Z","snapshot_observed_at":"2026-08-16T17:53:59.588658Z","submitted_at":"2025-05-23T11:41:26Z","title":"R-Genie: Reasoning-Guided Generative Image Editing","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:34.827824Z"},"links":{"cited_paper":"/paper/2503.10639","citing_paper":"/paper/2505.17768"},"observation_digest":"sha256:013dee76c04ea2c8d1a2cc96da8fe002af04449bf397b7e2f8b843e2636bcc5d","observation_id":"be32fd37-cc73-4585-8623-2b3b7073afb3","resolution":{"observed_at":"2026-08-07T14:46:34.827824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","snapshot_observed_at":"2026-08-16T19:00:31.865937Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10639","snapshot_observed_at":"2026-08-07T14:42:12.548057Z","title":"Got: Unleashing reasoning capability of multimodal large language model for visual generation and editing.arXiv preprint arXiv:2503.10639, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17908","last_updated":"2025-05-23T13:53:03Z","snapshot_observed_at":"2026-08-18T16:37:10.479591Z","submitted_at":"2025-05-23T13:53:03Z","title":"ComfyMind: Toward General-Purpose Generation via Tree-Based Planning and Reactive Feedback","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:12.548057Z"},"links":{"cited_paper":"/paper/2503.10639","citing_paper":"/paper/2505.17908"},"observation_digest":"sha256:61fa0143e95a3b291e741d065efec23a79ac7418c7887eebc131a5b34df5a9c8","observation_id":"c9887bfd-010f-452f-aed6-0082d6982958","resolution":{"observed_at":"2026-08-07T14:42:12.548057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","snapshot_observed_at":"2026-08-16T19:00:31.865937Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10639","snapshot_observed_at":"2026-08-07T14:20:41.061314Z","title":"Got: Unleashing reasoning capability of multimodal large language model for visual generation and editing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19352","last_updated":"2025-05-25T22:40:59Z","snapshot_observed_at":"2026-08-18T14:03:52.674810Z","submitted_at":"2025-05-25T22:40:59Z","title":"Beyond Editing Pairs: Fine-Grained Instructional Image Editing via Multi-Scale Learnable Regions","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:20:41.061314Z"},"links":{"cited_paper":"/paper/2503.10639","citing_paper":"/paper/2505.19352"},"observation_digest":"sha256:63614219def48eadb72fe72fdd927564790cfad3553b9ae91e7c8a09d446cfde","observation_id":"1614e1a3-3500-4594-a6e6-ef53ad82de7f","resolution":{"observed_at":"2026-08-07T14:20:41.061314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","snapshot_observed_at":"2026-08-16T19:00:31.865937Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing","version":1},"cited_work":{"arxiv_id":"2503.10639","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10639","snapshot_observed_at":"2026-07-03T21:28:58.240235Z","title":"arXiv preprint arXiv:2503.10639 , year=","venue":null,"work_id":"685a5109-0d26-4c27-8c5e-c8ee1c75f197","year":2025},"citing_paper":{"arxiv_id":"2505.20275","last_updated":"2025-05-26T17:53:33Z","snapshot_observed_at":"2026-08-17T20:13:42.723617Z","submitted_at":"2025-05-26T17:53:33Z","title":"ImgEdit: A Unified Image Editing Dataset and Benchmark","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-12T18:17:45.123690Z"},"links":{"cited_paper":"/paper/2503.10639","citing_paper":"/paper/2505.20275"},"observation_digest":"sha256:d639974e8e585a6e9bef01049e4f80a4da06e2c38751b6e91f1b852a95703c49","observation_id":"db554c65-c3ad-45c8-9371-8fe68adb408c","resolution":{"observed_at":"2026-05-12T18:17:45.508850Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","snapshot_observed_at":"2026-08-16T19:00:31.865937Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10639","snapshot_observed_at":"2026-08-07T12:18:32.501235Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24787","last_updated":"2025-05-30T16:48:14Z","snapshot_observed_at":"2026-08-13T04:32:44.496715Z","submitted_at":"2025-05-30T16:48:14Z","title":"Draw ALL Your Imagine: A Holistic Benchmark and Agent Framework for Complex Instruction-based Image Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:32.501235Z"},"links":{"cited_paper":"/paper/2503.10639","citing_paper":"/paper/2505.24787"},"observation_digest":"sha256:784fb0ab75aa4b1cfdfa69f1e23598d9c4f041d3df8bed7fc400b8752c365cc3","observation_id":"f9e05ca0-be08-4147-969c-b18a3d36e5a5","resolution":{"observed_at":"2026-08-07T12:18:32.501235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","snapshot_observed_at":"2026-08-16T19:00:31.865937Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10639","snapshot_observed_at":"2026-08-07T06:07:24.165875Z","title":"GoT : Unleashing reasoning capability of multimodal large language model for visual generation and editing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06006","last_updated":"2026-06-03T11:54:47Z","snapshot_observed_at":"2026-08-17T07:13:31.115974Z","submitted_at":"2025-06-06T11:50:18Z","title":"Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:24.165875Z"},"links":{"cited_paper":"/paper/2503.10639","citing_paper":"/paper/2506.06006"},"observation_digest":"sha256:36460306094b6009566f950d7897e9dec117f8ff47585401a3bf564b8465ac56","observation_id":"e85fb9d6-0103-4439-b9cc-e33646806b97","resolution":{"observed_at":"2026-08-07T06:07:24.165875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","snapshot_observed_at":"2026-08-16T19:00:31.865937Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10639","snapshot_observed_at":"2026-08-07T00:40:19.605957Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12830","last_updated":"2025-06-15T12:22:55Z","snapshot_observed_at":"2026-08-16T20:45:45.867125Z","submitted_at":"2025-06-15T12:22:55Z","title":"ComplexBench-Edit: Benchmarking Complex Instruction-Driven Image Editing via Compositional Dependencies","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:19.605957Z"},"links":{"cited_paper":"/paper/2503.10639","citing_paper":"/paper/2506.12830"},"observation_digest":"sha256:4ca8b6e093da1e163334a7a8a8b0028a511956d5ed2b32204606b6751ac85ed9","observation_id":"74ba5345-9cb4-4895-ac99-6692f515617b","resolution":{"observed_at":"2026-08-07T00:40:19.605957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","snapshot_observed_at":"2026-08-16T19:00:31.865937Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10639","snapshot_observed_at":"2026-08-15T18:46:10.647842Z","title":"Got: Unleashing reasoning capability of multimodal large language model for visual generation and editing.arXiv preprint arXiv:2503.10639, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18898","last_updated":"2025-06-23T17:59:14Z","snapshot_observed_at":"2026-08-15T23:43:47.561047Z","submitted_at":"2025-06-23T17:59:14Z","title":"Vision as a Dialect: Unifying Visual Understanding and Generation via Text-Aligned Representations","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T18:46:10.647842Z"},"links":{"cited_paper":"/paper/2503.10639","citing_paper":"/paper/2506.18898"},"observation_digest":"sha256:2d99cf32c9448fbc764e9dea56892adf6954f87565f685251b7fbd3528f41f4c","observation_id":"0aea6666-678d-4dcf-bd4f-d7c7a8949f0c","resolution":{"observed_at":"2026-08-15T18:46:10.647842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","snapshot_observed_at":"2026-08-16T19:00:31.865937Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10639","snapshot_observed_at":"2026-08-06T05:40:56.881671Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.01394","last_updated":"2025-08-02T14:58:34Z","snapshot_observed_at":"2026-08-13T04:59:53.715868Z","submitted_at":"2025-08-02T14:58:34Z","title":"Via Score to Performance: Efficient Human-Controllable Long Song Generation with Bar-Level Symbolic Notation","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T05:40:56.881671Z"},"links":{"cited_paper":"/paper/2503.10639","citing_paper":"/paper/2508.01394"},"observation_digest":"sha256:968e4e8c4ccc7848e15dd638a43e82f8383818fead3487cacc5cc8c07e3481de","observation_id":"0feb2e14-1f15-4d9d-b0ec-05c9ae66f644","resolution":{"observed_at":"2026-08-06T05:40:56.881671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","snapshot_observed_at":"2026-08-16T19:00:31.865937Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10639","snapshot_observed_at":"2026-08-15T17:03:42.934010Z","title":"In Forty-first international conference on machine learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.18032","last_updated":"2025-08-26T07:43:06Z","snapshot_observed_at":"2026-08-17T11:11:23.335972Z","submitted_at":"2025-08-25T13:53:02Z","title":"Visual-CoG: Stage-Aware Reinforcement Learning with Chain of Guidance for Text-to-Image Generation","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-15T17:03:42.934010Z"},"links":{"cited_paper":"/paper/2503.10639","citing_paper":"/paper/2508.18032"},"observation_digest":"sha256:0079f0639839e10e32e7219489acb57f01f228804481d18d977bf1538ced4be9","observation_id":"e584b0c6-8dab-44f3-8a1c-0762cb7b68e5","resolution":{"observed_at":"2026-08-15T17:03:42.934010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","snapshot_observed_at":"2026-08-16T19:00:31.865937Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing","version":1},"cited_work":{"arxiv_id":"2503.10639","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10639","snapshot_observed_at":"2026-07-03T21:28:58.240235Z","title":"arXiv preprint arXiv:2503.10639 , year=","venue":null,"work_id":"685a5109-0d26-4c27-8c5e-c8ee1c75f197","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":256,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2503.10639","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:aeaeb8d2f1498cffb6f0425b0ffa84c984a3bf70904c8c8c52b8abfc1e5b0e69","observation_id":"5be1d564-b5ec-4ea8-b747-5d355dacab17","resolution":{"observed_at":"2026-05-18T19:21:48.132193Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","snapshot_observed_at":"2026-08-16T19:00:31.865937Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10639","snapshot_observed_at":"2026-08-05T10:24:55.232863Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.04126","last_updated":"2025-09-14T00:18:40Z","snapshot_observed_at":"2026-08-20T12:03:26.060397Z","submitted_at":"2025-09-04T11:44:28Z","title":"MEPG:Multi-Expert Planning and Generation for Compositionally-Rich Image Generation","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-05T10:24:55.232863Z"},"links":{"cited_paper":"/paper/2503.10639","citing_paper":"/paper/2509.04126"},"observation_digest":"sha256:80833d5a75e4f3a5a404e5ccaef43947f5ee2bfba314370730c2bbaaa9a19cad","observation_id":"86739b7b-e6d6-4ebd-a99e-dd28b5e1bf17","resolution":{"observed_at":"2026-08-05T10:24:55.232863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","snapshot_observed_at":"2026-08-16T19:00:31.865937Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10639","snapshot_observed_at":"2026-08-04T22:55:44.877594Z","title":"Got: Unleashing reasoning capability of multimodal large language model for visual generation and editing.arXiv preprint arXiv:2503.10639,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06945","last_updated":"2025-09-09T10:50:30Z","snapshot_observed_at":"2026-08-17T07:21:36.818837Z","submitted_at":"2025-09-08T17:56:23Z","title":"Interleaving Reasoning for Better Text-to-Image Generation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:44.877594Z"},"links":{"cited_paper":"/paper/2503.10639","citing_paper":"/paper/2509.06945"},"observation_digest":"sha256:3d6f0f048dab722f39f9d0feb864f3f7e89f597724860ee18ba36ad409c242dc","observation_id":"9f56752a-f678-4670-b871-473500b61ff1","resolution":{"observed_at":"2026-08-04T22:55:44.877594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","snapshot_observed_at":"2026-08-16T19:00:31.865937Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10639","snapshot_observed_at":"2026-08-04T22:36:07.936009Z","title":"Got: Unleashing reasoning capability of multimodal large language model for visual generation and editing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.07295","last_updated":"2026-06-25T06:17:40Z","snapshot_observed_at":"2026-08-21T08:23:59.555206Z","submitted_at":"2025-09-08T23:59:32Z","title":"Reconstruction Alignment Improves Unified Multimodal Models","version":4},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-04T22:36:07.936009Z"},"links":{"cited_paper":"/paper/2503.10639","citing_paper":"/paper/2509.07295"},"observation_digest":"sha256:843eb0b0aff32a11a63ac5cccec0acc57b629cf8ae14cd1b6fcd0448b0506441","observation_id":"1ad52245-d29a-460c-bd5d-77ca3b5b34fb","resolution":{"observed_at":"2026-08-04T22:36:07.936009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","snapshot_observed_at":"2026-08-16T19:00:31.865937Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10639","snapshot_observed_at":"2026-08-04T18:48:03.645811Z","title":"Got: Unleashing reasoning capability of multimodal large language model for visual generation and editing.arXiv preprint arXiv:2503.10639, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-20T21:06:45.900297Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T18:48:03.645811Z"},"links":{"cited_paper":"/paper/2503.10639","citing_paper":"/paper/2509.09680"},"observation_digest":"sha256:ebd674f0dc3b6b9eab83dd75f87aa2f7d6eb60b3a526f91c549cf0d0f2dde6f3","observation_id":"15feb0bb-9423-4260-a030-ccd50ba0b956","resolution":{"observed_at":"2026-08-04T18:48:03.645811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","snapshot_observed_at":"2026-08-16T19:00:31.865937Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10639","snapshot_observed_at":"2026-08-04T09:54:24.239016Z","title":"Got: Unleashing reasoning capability of multimodal large language model for visual generation and editing.arXiv preprint arXiv:2503.10639,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.12784","last_updated":"2026-06-28T11:09:54Z","snapshot_observed_at":"2026-08-14T14:23:49.598555Z","submitted_at":"2025-10-14T17:56:11Z","title":"SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T09:54:24.239016Z"},"links":{"cited_paper":"/paper/2503.10639","citing_paper":"/paper/2510.12784"},"observation_digest":"sha256:86e1a46dbadee5ab290aa5ebdf876cdadb0bff4608c5de1655b4f46ddaefa7bd","observation_id":"c317703b-34b2-4365-81ba-33f4da95b3ef","resolution":{"observed_at":"2026-08-04T09:54:24.239016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","snapshot_observed_at":"2026-08-16T19:00:31.865937Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10639","snapshot_observed_at":"2026-08-03T17:06:54.722954Z","title":"Got: Unleashing reasoning capability of multimodal large language model for visual generation and editing.arXiv preprint arXiv:2503.10639, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-21T11:34:51.111103Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:54.722954Z"},"links":{"cited_paper":"/paper/2503.10639","citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:d248e7054fc2197c536c985a28266b21fbbcc5235175f5abf5b56d702c1e122d","observation_id":"b5450353-038d-4dac-a264-4d7fa7247780","resolution":{"observed_at":"2026-08-03T17:06:54.722954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","snapshot_observed_at":"2026-08-16T19:00:31.865937Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing","version":1},"cited_work":{"arxiv_id":"2503.10639","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10639","snapshot_observed_at":"2026-07-03T21:28:58.240235Z","title":"arXiv preprint arXiv:2503.10639 , year=","venue":null,"work_id":"685a5109-0d26-4c27-8c5e-c8ee1c75f197","year":2025},"citing_paper":{"arxiv_id":"2512.13609","last_updated":"2026-05-14T17:13:30Z","snapshot_observed_at":"2026-08-16T17:44:16.598070Z","submitted_at":"2025-12-15T18:03:42Z","title":"Do-Undo Bench: Reversibility for Action Understanding in Image Generation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-16T22:10:29.304091Z"},"links":{"cited_paper":"/paper/2503.10639","citing_paper":"/paper/2512.13609"},"observation_digest":"sha256:48b664805c6e35501785059854e6354433095e2454b7f41f7f23f527004d4842","observation_id":"f8b3094d-71f9-4f13-968f-a51d8674b083","resolution":{"observed_at":"2026-05-16T22:11:18.473960Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","snapshot_observed_at":"2026-08-16T19:00:31.865937Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10639","snapshot_observed_at":"2026-07-13T23:27:11.006580Z","title":"arXiv preprint arXiv:2503.10639 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-20T17:53:01.671184Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-13T23:27:11.006580Z"},"links":{"cited_paper":"/paper/2503.10639","citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:8cbcbb3ade68b3c2cfdfab9918426410c04a944c6b0794d83f2ceead5de4e3ef","observation_id":"b4f0b072-f1dc-495e-9848-97a5fb37d484","resolution":{"observed_at":"2026-07-13T23:27:11.006580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","snapshot_observed_at":"2026-08-16T19:00:31.865937Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10639","snapshot_observed_at":"2026-08-03T02:33:53.930732Z","title":"arXiv preprint arXiv:2503.10639 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-20T17:53:01.671184Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T02:33:53.930732Z"},"links":{"cited_paper":"/paper/2503.10639","citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:8fd3fafccc58b086ac9c5e6a49f5184b69c7dc30d58ebf7fc7571110d32fa0f9","observation_id":"3766ccda-d2e8-4b89-a5ea-a612eab982a5","resolution":{"observed_at":"2026-08-03T02:33:53.930732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","snapshot_observed_at":"2026-08-16T19:00:31.865937Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing","version":1},"cited_work":{"arxiv_id":"2503.10639","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10639","snapshot_observed_at":"2026-07-03T21:28:58.240235Z","title":"arXiv preprint arXiv:2503.10639 , year=","venue":null,"work_id":"685a5109-0d26-4c27-8c5e-c8ee1c75f197","year":2025},"citing_paper":{"arxiv_id":"2604.10454","last_updated":"2026-04-12T04:32:30Z","snapshot_observed_at":"2026-08-15T18:42:07.457522Z","submitted_at":"2026-04-12T04:32:30Z","title":"AIM-Bench: Benchmarking and Improving Affective Image Manipulation via Fine-Grained Hierarchical Control","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T15:35:49.575589Z"},"links":{"cited_paper":"/paper/2503.10639","citing_paper":"/paper/2604.10454"},"observation_digest":"sha256:9d58e8d6b301d87a59c8a38a6faf2f529a11449b6f695b4af85c11a46a501e1b","observation_id":"14adf7f1-dbb3-474f-be97-4dc5bf312958","resolution":{"observed_at":"2026-05-11T10:11:04.280660Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","snapshot_observed_at":"2026-08-16T19:00:31.865937Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing","version":1},"cited_work":{"arxiv_id":"2503.10639","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10639","snapshot_observed_at":"2026-07-03T21:28:58.240235Z","title":"arXiv preprint arXiv:2503.10639 , year=","venue":null,"work_id":"685a5109-0d26-4c27-8c5e-c8ee1c75f197","year":2025},"citing_paper":{"arxiv_id":"2604.23763","last_updated":"2026-04-30T04:05:16Z","snapshot_observed_at":"2026-08-11T09:39:21.336709Z","submitted_at":"2026-04-26T15:28:02Z","title":"Edit Where You Mean: Region-Aware Adapter Injection for Mask-Free Local Image Editing","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-08T06:47:22.451132Z"},"links":{"cited_paper":"/paper/2503.10639","citing_paper":"/paper/2604.23763"},"observation_digest":"sha256:d7f988def7023755c3959eb0e345d062184a70954394f54463dc468be7dbedc3","observation_id":"62b9b7dc-027b-415e-9552-c6643be237f4","resolution":{"observed_at":"2026-05-11T21:06:13.722077Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","snapshot_observed_at":"2026-08-16T19:00:31.865937Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing","version":1},"cited_work":{"arxiv_id":"2503.10639","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10639","snapshot_observed_at":"2026-07-03T21:28:58.240235Z","title":"arXiv preprint arXiv:2503.10639 , year=","venue":null,"work_id":"685a5109-0d26-4c27-8c5e-c8ee1c75f197","year":2025},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"cited_paper":"/paper/2503.10639","citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:3ee39af20c4731ebff8ddea4987e19f3702a5c50ea91cae1cb49ebfdba2cc2fe","observation_id":"c251ec09-3171-4a66-8787-bfef63b28c40","resolution":{"observed_at":"2026-05-11T21:41:19.274947Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","snapshot_observed_at":"2026-08-16T19:00:31.865937Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing","version":1},"cited_work":{"arxiv_id":"2503.10639","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10639","snapshot_observed_at":"2026-07-03T21:28:58.240235Z","title":"arXiv preprint arXiv:2503.10639 , year=","venue":null,"work_id":"685a5109-0d26-4c27-8c5e-c8ee1c75f197","year":2025},"citing_paper":{"arxiv_id":"2605.07334","last_updated":"2026-05-08T06:39:53Z","snapshot_observed_at":"2026-08-12T22:45:35.785489Z","submitted_at":"2026-05-08T06:39:53Z","title":"RCoT-Seg: Reinforced Chain-of-Thought for Video Reasoning and Segmentation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-11T01:16:25.031349Z"},"links":{"cited_paper":"/paper/2503.10639","citing_paper":"/paper/2605.07334"},"observation_digest":"sha256:863c852c4a6ba7fcf74800b16efec99523c759f9431db91d996399b3110ee1df","observation_id":"2cbfaf2e-1b78-4469-9421-422f690c10d1","resolution":{"observed_at":"2026-05-11T04:31:00.029682Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","snapshot_observed_at":"2026-08-16T19:00:31.865937Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing","version":1},"cited_work":{"arxiv_id":"2503.10639","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10639","snapshot_observed_at":"2026-07-03T21:28:58.240235Z","title":"arXiv preprint arXiv:2503.10639 , year=","venue":null,"work_id":"685a5109-0d26-4c27-8c5e-c8ee1c75f197","year":2025},"citing_paper":{"arxiv_id":"2605.10859","last_updated":"2026-05-11T17:05:52Z","snapshot_observed_at":"2026-08-02T17:39:12.809856Z","submitted_at":"2026-05-11T17:05:52Z","title":"Masked Generative Transformer Is What You Need for Image Editing","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-12T04:35:52.355925Z"},"links":{"cited_paper":"/paper/2503.10639","citing_paper":"/paper/2605.10859"},"observation_digest":"sha256:3a2023e816c6281355a87af76398fa7d2b383c9460b6e0c06ff233dce8cce1e6","observation_id":"af9e71d7-eece-42b0-b3e3-f446fe819732","resolution":{"observed_at":"2026-05-12T06:06:26.027511Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","snapshot_observed_at":"2026-08-16T19:00:31.865937Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing","version":1},"cited_work":{"arxiv_id":"2503.10639","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10639","snapshot_observed_at":"2026-07-03T21:28:58.240235Z","title":"arXiv preprint arXiv:2503.10639 , year=","venue":null,"work_id":"685a5109-0d26-4c27-8c5e-c8ee1c75f197","year":2025},"citing_paper":{"arxiv_id":"2605.11400","last_updated":"2026-05-12T01:43:57Z","snapshot_observed_at":"2026-08-12T23:46:44.282001Z","submitted_at":"2026-05-12T01:43:57Z","title":"UniPath: Adaptive Coordination of Understanding and Generation for Unified Multimodal Reasoning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-13T01:29:23.774196Z"},"links":{"cited_paper":"/paper/2503.10639","citing_paper":"/paper/2605.11400"},"observation_digest":"sha256:c586cadbefcedc4dc3dd2a39fca740a8716d8fa4362b66a4ed5cf584b94220c2","observation_id":"2eb83584-ced1-4f53-b90d-a9e56d3d8c6c","resolution":{"observed_at":"2026-05-13T01:47:04.960167Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","snapshot_observed_at":"2026-08-16T19:00:31.865937Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing","version":1},"cited_work":{"arxiv_id":"2503.10639","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10639","snapshot_observed_at":"2026-07-03T21:28:58.240235Z","title":"arXiv preprint arXiv:2503.10639 , year=","venue":null,"work_id":"685a5109-0d26-4c27-8c5e-c8ee1c75f197","year":2025},"citing_paper":{"arxiv_id":"2605.14842","last_updated":"2026-05-14T13:46:24Z","snapshot_observed_at":"2026-08-12T22:57:10.943424Z","submitted_at":"2026-05-14T13:46:24Z","title":"Editor's Choice: Evaluating Abstract Intent in Image Editing through Atomic Entity Analysis","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-30T21:41:10.852265Z"},"links":{"cited_paper":"/paper/2503.10639","citing_paper":"/paper/2605.14842"},"observation_digest":"sha256:03ad3c61e8389f8ca28a139ce3b1a7508278de22b3200c1648a08fb4c4858837","observation_id":"65c4a275-426e-46cd-b7ad-8b45e09534c1","resolution":{"observed_at":"2026-07-01T14:25:46.043811Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","snapshot_observed_at":"2026-08-16T19:00:31.865937Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing","version":1},"cited_work":{"arxiv_id":"2503.10639","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10639","snapshot_observed_at":"2026-07-03T21:28:58.240235Z","title":"arXiv preprint arXiv:2503.10639 , year=","venue":null,"work_id":"685a5109-0d26-4c27-8c5e-c8ee1c75f197","year":2025},"citing_paper":{"arxiv_id":"2605.19852","last_updated":"2026-06-03T11:11:28Z","snapshot_observed_at":"2026-08-13T09:24:20.626075Z","submitted_at":"2026-05-19T13:44:26Z","title":"Are Tools Always Beneficial? Learning to Invoke Tools Adaptively for Dual-Mode Multimodal LLM Reasoning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-20T06:16:47.650748Z"},"links":{"cited_paper":"/paper/2503.10639","citing_paper":"/paper/2605.19852"},"observation_digest":"sha256:2450ae0616c2731753ad93eb5ede6a3aff74ae218241e67fcc571aaa9b5c7413","observation_id":"a57079f0-abd8-431f-ac79-e66a5a1ac02e","resolution":{"observed_at":"2026-05-20T06:18:05.182007Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","snapshot_observed_at":"2026-08-16T19:00:31.865937Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing","version":1},"cited_work":{"arxiv_id":"2503.10639","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10639","snapshot_observed_at":"2026-07-03T21:28:58.240235Z","title":"arXiv preprint arXiv:2503.10639 , year=","venue":null,"work_id":"685a5109-0d26-4c27-8c5e-c8ee1c75f197","year":2025},"citing_paper":{"arxiv_id":"2606.04479","last_updated":"2026-06-03T05:53:58Z","snapshot_observed_at":"2026-08-17T12:02:57.660397Z","submitted_at":"2026-06-03T05:53:58Z","title":"Evaluating Reasoning Fidelity in Visual Text Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-28T07:03:38.967856Z"},"links":{"cited_paper":"/paper/2503.10639","citing_paper":"/paper/2606.04479"},"observation_digest":"sha256:c024d2b056906150de7dcb54ddd4e7979a591d991a430135bdf0a329848f2adf","observation_id":"14463bd6-eece-4c48-8105-59f7a7b1fb00","resolution":{"observed_at":"2026-07-02T07:16:44.516479Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","snapshot_observed_at":"2026-08-16T19:00:31.865937Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing","version":1},"cited_work":{"arxiv_id":"2503.10639","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10639","snapshot_observed_at":"2026-07-03T21:28:58.240235Z","title":"arXiv preprint arXiv:2503.10639 , year=","venue":null,"work_id":"685a5109-0d26-4c27-8c5e-c8ee1c75f197","year":2025},"citing_paper":{"arxiv_id":"2606.05031","last_updated":"2026-06-03T15:58:56Z","snapshot_observed_at":"2026-08-13T09:30:06.328516Z","submitted_at":"2026-06-03T15:58:56Z","title":"MetaPoint: Unlocking Precise Spatial Control in Agentic Visual Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T06:07:06.056441Z"},"links":{"cited_paper":"/paper/2503.10639","citing_paper":"/paper/2606.05031"},"observation_digest":"sha256:f12ee6761bb8989ad5c12440e982ae9367e9d84ffeffbda3620d3b537aeeab62","observation_id":"814bee08-d142-41f8-bbd4-71e59b4c17f1","resolution":{"observed_at":"2026-07-02T08:26:47.752091Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","snapshot_observed_at":"2026-08-16T19:00:31.865937Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing","version":1},"cited_work":{"arxiv_id":"2503.10639","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10639","snapshot_observed_at":"2026-07-03T21:28:58.240235Z","title":"arXiv preprint arXiv:2503.10639 , year=","venue":null,"work_id":"685a5109-0d26-4c27-8c5e-c8ee1c75f197","year":2025},"citing_paper":{"arxiv_id":"2607.00920","last_updated":"2026-07-02T02:41:37Z","snapshot_observed_at":"2026-08-16T19:26:50.550156Z","submitted_at":"2026-07-01T13:23:45Z","title":"GMO-E$^2$DIT: Grounded Multi-Operation Editing for E-Commerce Images","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-02T13:56:43.671622Z"},"links":{"cited_paper":"/paper/2503.10639","citing_paper":"/paper/2607.00920"},"observation_digest":"sha256:bb4b18057fb9f4b999d3bc4bd7a2b5e281d2bc12bddef09f56d04c17af53bba4","observation_id":"364406dd-a65b-4b65-8622-0a880d401306","resolution":{"observed_at":"2026-07-02T13:56:58.969221Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","snapshot_observed_at":"2026-08-16T19:00:31.865937Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing","version":1},"cited_work":{"arxiv_id":"2503.10639","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10639","snapshot_observed_at":"2026-07-03T21:28:58.240235Z","title":"arXiv preprint arXiv:2503.10639 , year=","venue":null,"work_id":"685a5109-0d26-4c27-8c5e-c8ee1c75f197","year":2025},"citing_paper":{"arxiv_id":"2607.00920","last_updated":"2026-07-02T02:41:37Z","snapshot_observed_at":"2026-08-16T19:26:50.550156Z","submitted_at":"2026-07-01T13:23:45Z","title":"GMO-E$^2$DIT: Grounded Multi-Operation Editing for E-Commerce Images","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-03T21:23:41.271521Z"},"links":{"cited_paper":"/paper/2503.10639","citing_paper":"/paper/2607.00920"},"observation_digest":"sha256:ffbe728efedf62c7ca401b6b325e7e647c3febc510b49c9eac72e1bddf6d28ed","observation_id":"e6a8179a-8d93-479a-90dc-1b99efc7a669","resolution":{"observed_at":"2026-07-03T21:28:58.241767Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","snapshot_observed_at":"2026-08-16T19:00:31.865937Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10639","snapshot_observed_at":"2026-07-14T01:07:06.861298Z","title":"Got: Unleashing reasoning capability of multimodal large language model for visual generation and editing.arXiv preprint arXiv:2503.10639, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10004","last_updated":"2026-07-10T22:03:01Z","snapshot_observed_at":"2026-08-14T20:11:04.127435Z","submitted_at":"2026-07-10T22:03:01Z","title":"Model Guides You How to Draw: Adaptive Visual Gating for Unified Multimodal Reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-14T01:07:06.861298Z"},"links":{"cited_paper":"/paper/2503.10639","citing_paper":"/paper/2607.10004"},"observation_digest":"sha256:38ed06481224b728c545616aaa4e3b1207c5d7db9d23a34c3b88e40b5d190bbf","observation_id":"cec7d7d6-c797-4468-a227-9ac89c904e7a","resolution":{"observed_at":"2026-07-14T01:07:06.861298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2503.10639/citation-record","integrity":"/paper/2503.10639/integrity","json":"/paper/2503.10639/citation-record.json","paper":"/paper/2503.10639"},"outbound":[],"paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T19:00:31.865937Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 40 inbound Pith citation observations for arXiv:2503.10639."}