{"as_of":"2026-08-19T21:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8fd97f263e7380b1d2ae961796a28c776703ed2931ae3cc75477b3932b59360f","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-12T06:13:16.894125Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.02907/citation-record","integrity":"/paper/2607.02907/integrity","json":"/paper/2607.02907/citation-record.json","paper":"/paper/2607.02907"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:13:16.894125Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02907","last_updated":"2026-07-03T03:14:11Z","snapshot_observed_at":"2026-08-13T04:12:16.138751Z","submitted_at":"2026-07-03T03:14:11Z","title":"ProLaViT: Learning Progressive Latent Visual Thoughts in Structured Latent Space","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-12T06:13:16.894125Z"},"links":{"citing_paper":"/paper/2607.02907"},"observation_digest":"sha256:7b65561a6d421c2ff07d2ed3f41d0095f8f394e11ab5b656ce346ffe55462117","observation_id":"ccf14ef3-9a4f-40c6-a3c5-23f9d128d5bb","resolution":{"observed_at":"2026-07-12T06:13:16.894125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:13:16.894125Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02907","last_updated":"2026-07-03T03:14:11Z","snapshot_observed_at":"2026-08-13T04:12:16.138751Z","submitted_at":"2026-07-03T03:14:11Z","title":"ProLaViT: Learning Progressive Latent Visual Thoughts in Structured Latent Space","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-12T06:13:16.894125Z"},"links":{"citing_paper":"/paper/2607.02907"},"observation_digest":"sha256:debf58ef2727b5163395063b67e882296a33b65e2b57d8f5d3bbdaffb2a9d5e2","observation_id":"d3624285-5038-4257-b021-48d2d18e654b","resolution":{"observed_at":"2026-07-12T06:13:16.894125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06135","last_updated":"2024-07-08T17:08:02Z","snapshot_observed_at":"2026-08-18T15:44:36.014181Z","submitted_at":"2024-07-08T17:08:02Z","title":"ANOLE: An Open, Autoregressive, Native Large Multimodal Models for Interleaved Image-Text Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06135","snapshot_observed_at":"2026-07-12T06:13:16.894125Z","title":"arXiv preprint arXiv:2407.06135 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02907","last_updated":"2026-07-03T03:14:11Z","snapshot_observed_at":"2026-08-13T04:12:16.138751Z","submitted_at":"2026-07-03T03:14:11Z","title":"ProLaViT: Learning Progressive Latent Visual Thoughts in Structured Latent Space","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-12T06:13:16.894125Z"},"links":{"cited_paper":"/paper/2407.06135","citing_paper":"/paper/2607.02907"},"observation_digest":"sha256:0179d0a974680fe506c058e7d446dedf163b8adb05db180f7a390454fa3e88e5","observation_id":"dfeaea4e-7ee4-4034-859c-520013f7dba4","resolution":{"observed_at":"2026-07-12T06:13:16.894125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14683","last_updated":"2025-07-27T11:45:16Z","snapshot_observed_at":"2026-08-17T01:11:44.872398Z","submitted_at":"2025-05-20T17:59:30Z","title":"Emerging Properties in Unified Multimodal Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14683","snapshot_observed_at":"2026-07-12T06:13:16.894125Z","title":"arXiv preprint arXiv:2505.14683 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02907","last_updated":"2026-07-03T03:14:11Z","snapshot_observed_at":"2026-08-13T04:12:16.138751Z","submitted_at":"2026-07-03T03:14:11Z","title":"ProLaViT: Learning Progressive Latent Visual Thoughts in Structured Latent Space","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-12T06:13:16.894125Z"},"links":{"cited_paper":"/paper/2505.14683","citing_paper":"/paper/2607.02907"},"observation_digest":"sha256:950a516a344db682ff021c385cc0e6628469da63439f26972a59e84dc340a37e","observation_id":"ace27bdf-4f2f-484d-9296-36f005d84f7f","resolution":{"observed_at":"2026-07-12T06:13:16.894125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:13:16.894125Z","title":"In: The Twelfth International Conference on Learning Representations (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02907","last_updated":"2026-07-03T03:14:11Z","snapshot_observed_at":"2026-08-13T04:12:16.138751Z","submitted_at":"2026-07-03T03:14:11Z","title":"ProLaViT: Learning Progressive Latent Visual Thoughts in Structured Latent Space","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-12T06:13:16.894125Z"},"links":{"citing_paper":"/paper/2607.02907"},"observation_digest":"sha256:d488fbc5be9bdfb512d2657ed0463308da71f66b4a49c231ebe7bf915c5404c1","observation_id":"7f0b7584-d3db-4836-bb11-d69437d4c84a","resolution":{"observed_at":"2026-07-12T06:13:16.894125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:13:16.894125Z","title":"arXiv preprint arXiv:2512.05665 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02907","last_updated":"2026-07-03T03:14:11Z","snapshot_observed_at":"2026-08-13T04:12:16.138751Z","submitted_at":"2026-07-03T03:14:11Z","title":"ProLaViT: Learning Progressive Latent Visual Thoughts in Structured Latent Space","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-12T06:13:16.894125Z"},"links":{"citing_paper":"/paper/2607.02907"},"observation_digest":"sha256:d7f5b9c7fcbae07b82df87bff6d899d23cffa51efb8d4bba3380df540ba264ab","observation_id":"d00a47c3-79ab-4d33-8d07-369b3f0c7e2e","resolution":{"observed_at":"2026-07-12T06:13:16.894125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-19T03:51:01.804369Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-07-12T06:13:16.894125Z","title":"ArXivabs/2404.12390(2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02907","last_updated":"2026-07-03T03:14:11Z","snapshot_observed_at":"2026-08-13T04:12:16.138751Z","submitted_at":"2026-07-03T03:14:11Z","title":"ProLaViT: Learning Progressive Latent Visual Thoughts in Structured Latent Space","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-12T06:13:16.894125Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2607.02907"},"observation_digest":"sha256:6ac6d67d3020c2babbce334926db189045a54c8eccf2200a2b8ff462bff6f1aa","observation_id":"ae5cf0f9-eb9a-47b2-9552-76e22787a979","resolution":{"observed_at":"2026-07-12T06:13:16.894125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01218","last_updated":"2023-10-02T14:03:02Z","snapshot_observed_at":"2026-08-16T14:55:51.246316Z","submitted_at":"2023-10-02T14:03:02Z","title":"Making LLaMA SEE and Draw with SEED Tokenizer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01218","snapshot_observed_at":"2026-07-12T06:13:16.894125Z","title":"arXiv preprint arXiv:2310.01218 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02907","last_updated":"2026-07-03T03:14:11Z","snapshot_observed_at":"2026-08-13T04:12:16.138751Z","submitted_at":"2026-07-03T03:14:11Z","title":"ProLaViT: Learning Progressive Latent Visual Thoughts in Structured Latent Space","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-12T06:13:16.894125Z"},"links":{"cited_paper":"/paper/2310.01218","citing_paper":"/paper/2607.02907"},"observation_digest":"sha256:8e19bc4a86b51c40b2dc7440f1f084f43794f49eae33196104b9c44e0fb8246a","observation_id":"7c8cef05-b7ad-465a-a62c-34c53062e132","resolution":{"observed_at":"2026-07-12T06:13:16.894125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:13:16.894125Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02907","last_updated":"2026-07-03T03:14:11Z","snapshot_observed_at":"2026-08-13T04:12:16.138751Z","submitted_at":"2026-07-03T03:14:11Z","title":"ProLaViT: Learning Progressive Latent Visual Thoughts in Structured Latent Space","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-12T06:13:16.894125Z"},"links":{"citing_paper":"/paper/2607.02907"},"observation_digest":"sha256:4d8478bd49b1b94f6117287226989cb5a8b8ef78f687f95cd34bb1a8d67ff8a8","observation_id":"c8b01a7b-d051-452e-978c-cd82b89268a6","resolution":{"observed_at":"2026-07-12T06:13:16.894125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06769","last_updated":"2025-11-03T00:53:34Z","snapshot_observed_at":"2026-08-17T06:12:37.525438Z","submitted_at":"2024-12-09T18:55:56Z","title":"Training Large Language Models to Reason in a Continuous Latent Space","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06769","snapshot_observed_at":"2026-07-12T06:13:16.894125Z","title":"ArXiv abs/2412.06769(2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02907","last_updated":"2026-07-03T03:14:11Z","snapshot_observed_at":"2026-08-13T04:12:16.138751Z","submitted_at":"2026-07-03T03:14:11Z","title":"ProLaViT: Learning Progressive Latent Visual Thoughts in Structured Latent Space","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-12T06:13:16.894125Z"},"links":{"cited_paper":"/paper/2412.06769","citing_paper":"/paper/2607.02907"},"observation_digest":"sha256:7a4524d30e5ebd15f0045707f7150ba63568de10306e73153cc30b71fdb50bed","observation_id":"9e25d7ba-5be1-4c21-9e58-1c983d71c927","resolution":{"observed_at":"2026-07-12T06:13:16.894125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-18T04:15:44.692958Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-07-12T06:13:16.894125Z","title":"arXiv preprint arXiv:2501.05444 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02907","last_updated":"2026-07-03T03:14:11Z","snapshot_observed_at":"2026-08-13T04:12:16.138751Z","submitted_at":"2026-07-03T03:14:11Z","title":"ProLaViT: Learning Progressive Latent Visual Thoughts in Structured Latent Space","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-12T06:13:16.894125Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2607.02907"},"observation_digest":"sha256:02d58cae4b21cdc9340cd5f2b016befc8cd1256682595c98e20447f2cde4e195","observation_id":"1ad6a5de-5851-4a93-8ca7-e9b1d05f83b4","resolution":{"observed_at":"2026-07-12T06:13:16.894125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","snapshot_observed_at":"2026-08-17T11:53:37.450198Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09621","snapshot_observed_at":"2026-07-12T06:13:16.894125Z","title":"arXiv preprint arXiv:2502.09621 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02907","last_updated":"2026-07-03T03:14:11Z","snapshot_observed_at":"2026-08-13T04:12:16.138751Z","submitted_at":"2026-07-03T03:14:11Z","title":"ProLaViT: Learning Progressive Latent Visual Thoughts in Structured Latent Space","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-12T06:13:16.894125Z"},"links":{"cited_paper":"/paper/2502.09621","citing_paper":"/paper/2607.02907"},"observation_digest":"sha256:11e7a7333f11993108639c092c1b267058dcba852d77d41e8d3c481a559858a5","observation_id":"77198966-2992-4550-b956-aed73dcacc83","resolution":{"observed_at":"2026-07-12T06:13:16.894125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:13:16.894125Z","title":"2023 IEEE/CVF International Conference on Computer Vision (ICCV) pp","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02907","last_updated":"2026-07-03T03:14:11Z","snapshot_observed_at":"2026-08-13T04:12:16.138751Z","submitted_at":"2026-07-03T03:14:11Z","title":"ProLaViT: Learning Progressive Latent Visual Thoughts in Structured Latent Space","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-12T06:13:16.894125Z"},"links":{"citing_paper":"/paper/2607.02907"},"observation_digest":"sha256:66fceb533be4212ff330663a9e76ce31b97a880258f6a6289b6dc8adc25b0e9e","observation_id":"0930efad-55c4-4698-b47a-869db0e0978c","resolution":{"observed_at":"2026-07-12T06:13:16.894125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:13:16.894125Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02907","last_updated":"2026-07-03T03:14:11Z","snapshot_observed_at":"2026-08-13T04:12:16.138751Z","submitted_at":"2026-07-03T03:14:11Z","title":"ProLaViT: Learning Progressive Latent Visual Thoughts in Structured Latent Space","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-12T06:13:16.894125Z"},"links":{"citing_paper":"/paper/2607.02907"},"observation_digest":"sha256:cd366bc191c3a1059fa6fd4ee8950d39481748bbaab4efb6f1f5864b53c69fbf","observation_id":"85fb5e78-1b6b-4ffb-b413-665b16468233","resolution":{"observed_at":"2026-07-12T06:13:16.894125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:13:16.894125Z","title":"arXiv preprint arXiv:2507.16746 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02907","last_updated":"2026-07-03T03:14:11Z","snapshot_observed_at":"2026-08-13T04:12:16.138751Z","submitted_at":"2026-07-03T03:14:11Z","title":"ProLaViT: Learning Progressive Latent Visual Thoughts in Structured Latent Space","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-12T06:13:16.894125Z"},"links":{"citing_paper":"/paper/2607.02907"},"observation_digest":"sha256:43fad4bce4fdd9e26723a2948eb2829cec736c3d7ee6587234b634799589f700","observation_id":"2fa0aac7-5c72-436e-91ea-0cef63ac1d19","resolution":{"observed_at":"2026-07-12T06:13:16.894125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.24251","last_updated":"2025-10-05T04:01:18Z","snapshot_observed_at":"2026-08-10T21:20:13.670725Z","submitted_at":"2025-09-29T03:52:01Z","title":"Latent Visual Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.24251","snapshot_observed_at":"2026-07-12T06:13:16.894125Z","title":"ArXivabs/2509.24251(2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02907","last_updated":"2026-07-03T03:14:11Z","snapshot_observed_at":"2026-08-13T04:12:16.138751Z","submitted_at":"2026-07-03T03:14:11Z","title":"ProLaViT: Learning Progressive Latent Visual Thoughts in Structured Latent Space","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-12T06:13:16.894125Z"},"links":{"cited_paper":"/paper/2509.24251","citing_paper":"/paper/2607.02907"},"observation_digest":"sha256:3962295c45ca135b717596e3d1d0d16fce848006c668662fca66d350308eb8dc","observation_id":"3623f65b-955b-48ae-ba8b-27d00c2f4677","resolution":{"observed_at":"2026-07-12T06:13:16.894125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-07-12T06:13:16.894125Z","title":"ArXiv abs/2304.08485(2023) ProLaViT: Progressive Latent Visual Thoughts 17","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02907","last_updated":"2026-07-03T03:14:11Z","snapshot_observed_at":"2026-08-13T04:12:16.138751Z","submitted_at":"2026-07-03T03:14:11Z","title":"ProLaViT: Learning Progressive Latent Visual Thoughts in Structured Latent Space","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-12T06:13:16.894125Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2607.02907"},"observation_digest":"sha256:4844c37937a27af6b6031d7d9d32e25e7cfe2558991fd6b95cadc9e9f6199f94","observation_id":"e4483e54-9050-4c0d-8f3b-fbcb188cbb52","resolution":{"observed_at":"2026-07-12T06:13:16.894125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.09842","last_updated":"2023-10-31T17:43:39Z","snapshot_observed_at":"2026-08-18T03:05:32.170128Z","submitted_at":"2023-04-19T17:47:47Z","title":"Chameleon: Plug-and-Play Compositional Reasoning with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.09842","snapshot_observed_at":"2026-07-12T06:13:16.894125Z","title":"ArXivabs/2304.09842(2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02907","last_updated":"2026-07-03T03:14:11Z","snapshot_observed_at":"2026-08-13T04:12:16.138751Z","submitted_at":"2026-07-03T03:14:11Z","title":"ProLaViT: Learning Progressive Latent Visual Thoughts in Structured Latent Space","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-12T06:13:16.894125Z"},"links":{"cited_paper":"/paper/2304.09842","citing_paper":"/paper/2607.02907"},"observation_digest":"sha256:afa808abadf21ac086e981488cfedaa6c3086da3def0a3c462b587d3feab8263","observation_id":"3c20b941-e769-4c63-b017-00bb6aaa06ec","resolution":{"observed_at":"2026-07-12T06:13:16.894125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-08-11T03:45:43.920485Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-07-12T06:13:16.894125Z","title":"ArXiv abs/2203.10244(2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.02907","last_updated":"2026-07-03T03:14:11Z","snapshot_observed_at":"2026-08-13T04:12:16.138751Z","submitted_at":"2026-07-03T03:14:11Z","title":"ProLaViT: Learning Progressive Latent Visual Thoughts in Structured Latent Space","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-12T06:13:16.894125Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2607.02907"},"observation_digest":"sha256:210b1fe69849e0b1cf299428ddbdff5cf81dbf54a86d1a64f96ce996caf55765","observation_id":"b48112c1-dcdf-45a3-8498-5af63202a98a","resolution":{"observed_at":"2026-07-12T06:13:16.894125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:13:16.894125Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02907","last_updated":"2026-07-03T03:14:11Z","snapshot_observed_at":"2026-08-13T04:12:16.138751Z","submitted_at":"2026-07-03T03:14:11Z","title":"ProLaViT: Learning Progressive Latent Visual Thoughts in Structured Latent Space","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-12T06:13:16.894125Z"},"links":{"citing_paper":"/paper/2607.02907"},"observation_digest":"sha256:a07a16242515c8eacfb093e8aef7802e86b8f2493ee525288d9bb79989ab2a43","observation_id":"5901df41-4b18-459c-bde8-676f1f6f905c","resolution":{"observed_at":"2026-07-12T06:13:16.894125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-17T13:03:40.359628Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-12T06:13:16.894125Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02907","last_updated":"2026-07-03T03:14:11Z","snapshot_observed_at":"2026-08-13T04:12:16.138751Z","submitted_at":"2026-07-03T03:14:11Z","title":"ProLaViT: Learning Progressive Latent Visual Thoughts in Structured Latent Space","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-12T06:13:16.894125Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2607.02907"},"observation_digest":"sha256:4a412a93a712325f9339b085670a4e700f7c3235820ae351a5a1ddc04e946fc6","observation_id":"0595db59-bc54-4610-8de5-4e5002fc9bff","resolution":{"observed_at":"2026-07-12T06:13:16.894125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:13:16.894125Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02907","last_updated":"2026-07-03T03:14:11Z","snapshot_observed_at":"2026-08-13T04:12:16.138751Z","submitted_at":"2026-07-03T03:14:11Z","title":"ProLaViT: Learning Progressive Latent Visual Thoughts in Structured Latent Space","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-12T06:13:16.894125Z"},"links":{"citing_paper":"/paper/2607.02907"},"observation_digest":"sha256:5ecf229cc747f684fb58effe5270a14b5a5c26719325ef86845cc3152a87cc70","observation_id":"b2f66cdf-234c-4377-af3c-7425c7280148","resolution":{"observed_at":"2026-07-12T06:13:16.894125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:13:16.894125Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02907","last_updated":"2026-07-03T03:14:11Z","snapshot_observed_at":"2026-08-13T04:12:16.138751Z","submitted_at":"2026-07-03T03:14:11Z","title":"ProLaViT: Learning Progressive Latent Visual Thoughts in Structured Latent Space","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-12T06:13:16.894125Z"},"links":{"citing_paper":"/paper/2607.02907"},"observation_digest":"sha256:18426b89485ebd5381fba6785ed789586d69664d3512081a80066423e91d4b25","observation_id":"b47c4bfd-b6ff-4495-9b22-85efeff36a4b","resolution":{"observed_at":"2026-07-12T06:13:16.894125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:13:16.894125Z","title":"Advances in Neural Information Processing Systems 37 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02907","last_updated":"2026-07-03T03:14:11Z","snapshot_observed_at":"2026-08-13T04:12:16.138751Z","submitted_at":"2026-07-03T03:14:11Z","title":"ProLaViT: Learning Progressive Latent Visual Thoughts in Structured Latent Space","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-12T06:13:16.894125Z"},"links":{"citing_paper":"/paper/2607.02907"},"observation_digest":"sha256:9b1d852aa78454d482253759709773402d0b28cccf4b8ea112aea5638aa275cc","observation_id":"75967e87-5909-477e-8927-2c24a3df71fe","resolution":{"observed_at":"2026-07-12T06:13:16.894125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:13:16.894125Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02907","last_updated":"2026-07-03T03:14:11Z","snapshot_observed_at":"2026-08-13T04:12:16.138751Z","submitted_at":"2026-07-03T03:14:11Z","title":"ProLaViT: Learning Progressive Latent Visual Thoughts in Structured Latent Space","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-12T06:13:16.894125Z"},"links":{"citing_paper":"/paper/2607.02907"},"observation_digest":"sha256:0dae6197f78aca066751c9f8e3a4700427a216da6f499799be66fa4d313dc4b5","observation_id":"3c2c7b65-960e-442b-b492-f012ec1d3efe","resolution":{"observed_at":"2026-07-12T06:13:16.894125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.21074","last_updated":"2025-09-23T08:16:08Z","snapshot_observed_at":"2026-08-07T17:46:47.440455Z","submitted_at":"2025-02-28T14:07:48Z","title":"CODI: Compressing Chain-of-Thought into Continuous Space via Self-Distillation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.21074","snapshot_observed_at":"2026-07-12T06:13:16.894125Z","title":"arXiv preprint arXiv:2502.21074 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02907","last_updated":"2026-07-03T03:14:11Z","snapshot_observed_at":"2026-08-13T04:12:16.138751Z","submitted_at":"2026-07-03T03:14:11Z","title":"ProLaViT: Learning Progressive Latent Visual Thoughts in Structured Latent Space","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-12T06:13:16.894125Z"},"links":{"cited_paper":"/paper/2502.21074","citing_paper":"/paper/2607.02907"},"observation_digest":"sha256:6b643b08b5d0ca76066e6955dd7dace771e8e816ce441dabb8982a969461fee5","observation_id":"397ca14a-2671-4ceb-b76d-cf17f97ed777","resolution":{"observed_at":"2026-07-12T06:13:16.894125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:13:16.894125Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02907","last_updated":"2026-07-03T03:14:11Z","snapshot_observed_at":"2026-08-13T04:12:16.138751Z","submitted_at":"2026-07-03T03:14:11Z","title":"ProLaViT: Learning Progressive Latent Visual Thoughts in Structured Latent Space","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-12T06:13:16.894125Z"},"links":{"citing_paper":"/paper/2607.02907"},"observation_digest":"sha256:a7a9bdbf5169982495f1353989449453c139e4ccd9d58006c6b1cabd6e79ca96","observation_id":"cebbf10a-00ac-4408-a09d-631296424401","resolution":{"observed_at":"2026-07-12T06:13:16.894125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:13:16.894125Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02907","last_updated":"2026-07-03T03:14:11Z","snapshot_observed_at":"2026-08-13T04:12:16.138751Z","submitted_at":"2026-07-03T03:14:11Z","title":"ProLaViT: Learning Progressive Latent Visual Thoughts in Structured Latent Space","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-12T06:13:16.894125Z"},"links":{"citing_paper":"/paper/2607.02907"},"observation_digest":"sha256:9123338f33ba267ac79d5357317b2a060106462e4c69fec1ef188ce956d2a6c5","observation_id":"0e5d1061-29dd-424a-acc4-307495637f9d","resolution":{"observed_at":"2026-07-12T06:13:16.894125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:13:16.894125Z","title":"2024 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) pp","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02907","last_updated":"2026-07-03T03:14:11Z","snapshot_observed_at":"2026-08-13T04:12:16.138751Z","submitted_at":"2026-07-03T03:14:11Z","title":"ProLaViT: Learning Progressive Latent Visual Thoughts in Structured Latent Space","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-12T06:13:16.894125Z"},"links":{"citing_paper":"/paper/2607.02907"},"observation_digest":"sha256:79ac1189a6148d902a0c72d94ccfb4131cf27f4d8f0ac14a87629ca0a4d82b90","observation_id":"90b48c87-b6ca-4856-ba3b-14654bf9adfa","resolution":{"observed_at":"2026-07-12T06:13:16.894125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:13:16.894125Z","title":"arXiv preprint arXiv:2511.21395 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02907","last_updated":"2026-07-03T03:14:11Z","snapshot_observed_at":"2026-08-13T04:12:16.138751Z","submitted_at":"2026-07-03T03:14:11Z","title":"ProLaViT: Learning Progressive Latent Visual Thoughts in Structured Latent Space","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-12T06:13:16.894125Z"},"links":{"citing_paper":"/paper/2607.02907"},"observation_digest":"sha256:6d2f058fb6c790397c316e4e19569b8b054ab5c8657dcfb528b994b6a7041f65","observation_id":"26c0f1df-98a4-4b68-ac84-7e12f2e5abca","resolution":{"observed_at":"2026-07-12T06:13:16.894125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11903","last_updated":"2023-01-10T23:07:57Z","snapshot_observed_at":"2026-08-13T07:04:41.220509Z","submitted_at":"2022-01-28T02:33:07Z","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.11903","snapshot_observed_at":"2026-07-12T06:13:16.894125Z","title":"ArXiv abs/2201.11903(2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.02907","last_updated":"2026-07-03T03:14:11Z","snapshot_observed_at":"2026-08-13T04:12:16.138751Z","submitted_at":"2026-07-03T03:14:11Z","title":"ProLaViT: Learning Progressive Latent Visual Thoughts in Structured Latent Space","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-12T06:13:16.894125Z"},"links":{"cited_paper":"/paper/2201.11903","citing_paper":"/paper/2607.02907"},"observation_digest":"sha256:73a98faa8aed13cf2d789bc127d772f4f012c64dd6d0d98708452f58c631e512","observation_id":"6c7cb700-7dab-4aa1-b99f-9dd2c3a821ba","resolution":{"observed_at":"2026-07-12T06:13:16.894125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:13:16.894125Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02907","last_updated":"2026-07-03T03:14:11Z","snapshot_observed_at":"2026-08-13T04:12:16.138751Z","submitted_at":"2026-07-03T03:14:11Z","title":"ProLaViT: Learning Progressive Latent Visual Thoughts in Structured Latent Space","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-12T06:13:16.894125Z"},"links":{"citing_paper":"/paper/2607.02907"},"observation_digest":"sha256:6a96ad4c6aa7027b175afdc9e79799f6789aabbc78cde2de929f078ce59c2d6a","observation_id":"fdbccc51-6090-4b7e-bcc5-46c57032b0c6","resolution":{"observed_at":"2026-07-12T06:13:16.894125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:13:16.894125Z","title":"2024 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) pp","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02907","last_updated":"2026-07-03T03:14:11Z","snapshot_observed_at":"2026-08-13T04:12:16.138751Z","submitted_at":"2026-07-03T03:14:11Z","title":"ProLaViT: Learning Progressive Latent Visual Thoughts in Structured Latent Space","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-12T06:13:16.894125Z"},"links":{"citing_paper":"/paper/2607.02907"},"observation_digest":"sha256:af0d4729f557dbb922cfe9804bc13b3a01741dc7ec63cd9e1cb120580511f492","observation_id":"c38e1b2c-7cb5-43dd-ac7e-ab5f31788de9","resolution":{"observed_at":"2026-07-12T06:13:16.894125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:13:16.894125Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV)","venue":null,"work_id":null,"year":2087},"citing_paper":{"arxiv_id":"2607.02907","last_updated":"2026-07-03T03:14:11Z","snapshot_observed_at":"2026-08-13T04:12:16.138751Z","submitted_at":"2026-07-03T03:14:11Z","title":"ProLaViT: Learning Progressive Latent Visual Thoughts in Structured Latent Space","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-12T06:13:16.894125Z"},"links":{"citing_paper":"/paper/2607.02907"},"observation_digest":"sha256:b09067673c0814b4de6a91f694b3a249b51c66d0e0db91d5c78b0a3c208e66e9","observation_id":"550944cf-604d-4d80-9f28-a490530dce9f","resolution":{"observed_at":"2026-07-12T06:13:16.894125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:13:16.894125Z","title":"2024 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) pp","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02907","last_updated":"2026-07-03T03:14:11Z","snapshot_observed_at":"2026-08-13T04:12:16.138751Z","submitted_at":"2026-07-03T03:14:11Z","title":"ProLaViT: Learning Progressive Latent Visual Thoughts in Structured Latent Space","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-12T06:13:16.894125Z"},"links":{"citing_paper":"/paper/2607.02907"},"observation_digest":"sha256:de4f98be7097a43de9f18ec07df38a2fa695c4a3e92ee32571cc28b335513890","observation_id":"dce49d70-5ed9-4336-ab5f-1a58695e0794","resolution":{"observed_at":"2026-07-12T06:13:16.894125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17218","last_updated":"2025-06-20T17:59:31Z","snapshot_observed_at":"2026-08-13T03:28:19.590253Z","submitted_at":"2025-06-20T17:59:31Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.17218","snapshot_observed_at":"2026-07-12T06:13:16.894125Z","title":"ArXivabs/2506.17218(2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02907","last_updated":"2026-07-03T03:14:11Z","snapshot_observed_at":"2026-08-13T04:12:16.138751Z","submitted_at":"2026-07-03T03:14:11Z","title":"ProLaViT: Learning Progressive Latent Visual Thoughts in Structured Latent Space","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-12T06:13:16.894125Z"},"links":{"cited_paper":"/paper/2506.17218","citing_paper":"/paper/2607.02907"},"observation_digest":"sha256:222fb01f9317c87b6ae84ab22bfccc8f06fcbdecbcf77ebbeff3ecb76f187f5c","observation_id":"2e019a78-9093-467e-877b-216c3b32a019","resolution":{"observed_at":"2026-07-12T06:13:16.894125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:13:16.894125Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02907","last_updated":"2026-07-03T03:14:11Z","snapshot_observed_at":"2026-08-13T04:12:16.138751Z","submitted_at":"2026-07-03T03:14:11Z","title":"ProLaViT: Learning Progressive Latent Visual Thoughts in Structured Latent Space","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-12T06:13:16.894125Z"},"links":{"citing_paper":"/paper/2607.02907"},"observation_digest":"sha256:c45fce0ef178f72942f7714c3d8057a8d786b317b603caa188b8a044bf0ae412","observation_id":"96fe850c-129a-478f-9db1-e756b0b389cd","resolution":{"observed_at":"2026-07-12T06:13:16.894125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:13:16.894125Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02907","last_updated":"2026-07-03T03:14:11Z","snapshot_observed_at":"2026-08-13T04:12:16.138751Z","submitted_at":"2026-07-03T03:14:11Z","title":"ProLaViT: Learning Progressive Latent Visual Thoughts in Structured Latent Space","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-12T06:13:16.894125Z"},"links":{"citing_paper":"/paper/2607.02907"},"observation_digest":"sha256:b6948dd68974bfd8bc0a33c0e6651196a3ff0458b898e1e75f1e45caac3b33f1","observation_id":"006dfcb7-cb8a-47cf-a422-b2f2946b4f79","resolution":{"observed_at":"2026-07-12T06:13:16.894125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.02907","last_updated":"2026-07-03T03:14:11Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T04:12:16.138751Z","submitted_at":"2026-07-03T03:14:11Z","title":"ProLaViT: Learning Progressive Latent Visual Thoughts in Structured Latent Space"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":38,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 0 inbound Pith citation observations for arXiv:2607.02907."}