{"as_of":"2026-08-10T00:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a45ab4fb1dd077f4c7ac6c17dd2b450d795aa42b88be370027e5f347817c0c66","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:01:50.856287Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.04151/citation-record","integrity":"/paper/2507.04151/integrity","json":"/paper/2507.04151/citation-record.json","paper":"/paper/2507.04151"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.24787","last_updated":"2025-05-30T16:48:14Z","snapshot_observed_at":"2026-08-07T15:30:21.145991Z","submitted_at":"2025-05-30T16:48:14Z","title":"Draw ALL Your Imagine: A Holistic Benchmark and Agent Framework for Complex Instruction-based Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24787","snapshot_observed_at":"2026-08-06T20:01:48.603688Z","title":"Draw all your imagine: A holistic benchmark and agent framework for complex instruction-based image generation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04151","last_updated":"2025-07-05T20:16:32Z","snapshot_observed_at":"2026-08-08T10:04:41.494252Z","submitted_at":"2025-07-05T20:16:32Z","title":"Unlocking Compositional Control: Self-Supervision for LVLM-Based Image Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:48.603688Z"},"links":{"cited_paper":"/paper/2505.24787","citing_paper":"/paper/2507.04151"},"observation_digest":"sha256:bb09622936bf2418a38b209ad27ab6c3113c8726827230f0c50ea1ef1608c5eb","observation_id":"36ea33ba-720d-4b0d-a522-6a82941ee6aa","resolution":{"observed_at":"2026-08-06T20:01:48.603688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:48.681445Z","title":"Score: Story coherence and retrieval enhancement for ai narratives,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04151","last_updated":"2025-07-05T20:16:32Z","snapshot_observed_at":"2026-08-08T10:04:41.494252Z","submitted_at":"2025-07-05T20:16:32Z","title":"Unlocking Compositional Control: Self-Supervision for LVLM-Based Image Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:48.681445Z"},"links":{"citing_paper":"/paper/2507.04151"},"observation_digest":"sha256:769b5da8c0b6100d7ec55eb216f2bd2def525a6e79ad5a67d16bc93588cfd4b6","observation_id":"c0237661-a292-42e9-b8b0-f7c521d28f7a","resolution":{"observed_at":"2026-08-06T20:01:48.681445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20367","last_updated":"2025-08-07T08:34:03Z","snapshot_observed_at":"2026-08-08T03:11:31.159173Z","submitted_at":"2024-12-29T06:15:41Z","title":"Enhancing Code LLMs with Reinforcement Learning in Code Generation: A Survey","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.20367","snapshot_observed_at":"2026-08-06T20:01:48.736481Z","title":"Enhancing code llms with reinforcement learning in code generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04151","last_updated":"2025-07-05T20:16:32Z","snapshot_observed_at":"2026-08-08T10:04:41.494252Z","submitted_at":"2025-07-05T20:16:32Z","title":"Unlocking Compositional Control: Self-Supervision for LVLM-Based Image Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:48.736481Z"},"links":{"cited_paper":"/paper/2412.20367","citing_paper":"/paper/2507.04151"},"observation_digest":"sha256:c167ae51427ce6ae22bed56c3d21ea9c146688cf79a4559ac3c862c139db9c40","observation_id":"712b153c-1902-48dc-9661-2acf37a83993","resolution":{"observed_at":"2026-08-06T20:01:48.736481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:52.018654Z","title":"Diffusion models beat gans on image synthesis,","venue":null,"work_id":"f92f6a78-3dfc-4334-b131-ef7e3fcd4d71","year":2021},"citing_paper":{"arxiv_id":"2507.04151","last_updated":"2025-07-05T20:16:32Z","snapshot_observed_at":"2026-08-08T10:04:41.494252Z","submitted_at":"2025-07-05T20:16:32Z","title":"Unlocking Compositional Control: Self-Supervision for LVLM-Based Image Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:48.799947Z"},"links":{"citing_paper":"/paper/2507.04151"},"observation_digest":"sha256:532cd03fa16830ad1f0b929e4d5e787d3dfba17e3600c0f82c5234791bbce29f","observation_id":"471daa47-9b5e-439c-9265-31438a124170","resolution":{"observed_at":"2026-08-06T20:01:52.022091Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:52.008856Z","title":"Triple sequence generative adversarial nets for unsupervised image captioning,","venue":null,"work_id":"2195a10c-94e0-4431-a6fc-b3a190bf2b72","year":2021},"citing_paper":{"arxiv_id":"2507.04151","last_updated":"2025-07-05T20:16:32Z","snapshot_observed_at":"2026-08-08T10:04:41.494252Z","submitted_at":"2025-07-05T20:16:32Z","title":"Unlocking Compositional Control: Self-Supervision for LVLM-Based Image Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:48.852793Z"},"links":{"citing_paper":"/paper/2507.04151"},"observation_digest":"sha256:954759a40641ed6b343e3f726884776972a9f09b619114b446786bfbde0063a8","observation_id":"c1544d88-8c49-4e86-89c5-bce1d492e2cb","resolution":{"observed_at":"2026-08-06T20:01:52.012625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:48.915151Z","title":"Visual in-context learning for large vision-language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04151","last_updated":"2025-07-05T20:16:32Z","snapshot_observed_at":"2026-08-08T10:04:41.494252Z","submitted_at":"2025-07-05T20:16:32Z","title":"Unlocking Compositional Control: Self-Supervision for LVLM-Based Image Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:48.915151Z"},"links":{"citing_paper":"/paper/2507.04151"},"observation_digest":"sha256:9b997fa21b138a2a7562e064da803ae2a1954b3fd3ce0d2888e02ff66cbd2f31","observation_id":"0380e3cc-e4dd-4c90-8ed4-29e8044e2766","resolution":{"observed_at":"2026-08-06T20:01:48.915151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:48.968028Z","title":"Weak to strong generalization for large language models with multi-capabilities,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04151","last_updated":"2025-07-05T20:16:32Z","snapshot_observed_at":"2026-08-08T10:04:41.494252Z","submitted_at":"2025-07-05T20:16:32Z","title":"Unlocking Compositional Control: Self-Supervision for LVLM-Based Image Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:48.968028Z"},"links":{"citing_paper":"/paper/2507.04151"},"observation_digest":"sha256:84d3107117550e74773abd747f43e256fe5e8dd8ca30604c03e3d86445e137fc","observation_id":"5f51352c-1325-4fa7-8205-16168498195e","resolution":{"observed_at":"2026-08-06T20:01:48.968028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01377","last_updated":"2025-06-02T09:56:36Z","snapshot_observed_at":"2026-08-06T08:18:28.668841Z","submitted_at":"2025-01-02T17:37:20Z","title":"Improving Medical Large Vision-Language Models with Abnormal-Aware Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01377","snapshot_observed_at":"2026-08-06T20:01:49.027115Z","title":"Training medical large vision- language models with abnormal-aware feedback,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04151","last_updated":"2025-07-05T20:16:32Z","snapshot_observed_at":"2026-08-08T10:04:41.494252Z","submitted_at":"2025-07-05T20:16:32Z","title":"Unlocking Compositional Control: Self-Supervision for LVLM-Based Image Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:49.027115Z"},"links":{"cited_paper":"/paper/2501.01377","citing_paper":"/paper/2507.04151"},"observation_digest":"sha256:23192cd37c7ae042a69adab43caf7f40a5b626c6f1fabe91de6215d25a14487a","observation_id":"7c2e7e97-51ae-48d3-89ca-cb45602dea6d","resolution":{"observed_at":"2026-08-06T20:01:49.027115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02114","last_updated":"2021-11-03T10:16:39Z","snapshot_observed_at":"2026-08-02T08:12:49.547570Z","submitted_at":"2021-11-03T10:16:39Z","title":"LAION-400M: Open Dataset of CLIP-Filtered 400 Million Image-Text Pairs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02114","snapshot_observed_at":"2026-08-06T20:01:49.072704Z","title":"LAION-400M: open dataset of clip-filtered 400 million image-text pairs,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.04151","last_updated":"2025-07-05T20:16:32Z","snapshot_observed_at":"2026-08-08T10:04:41.494252Z","submitted_at":"2025-07-05T20:16:32Z","title":"Unlocking Compositional Control: Self-Supervision for LVLM-Based Image Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:49.072704Z"},"links":{"cited_paper":"/paper/2111.02114","citing_paper":"/paper/2507.04151"},"observation_digest":"sha256:0defe22f81dddae7e7bd1ea90ccd1f52331f31d81129db927634d2d8f6209611","observation_id":"e769d58f-c0b2-436b-b2a5-4884d2b33751","resolution":{"observed_at":"2026-08-06T20:01:49.072704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:49.124936Z","title":"Conceptual captions: A cleaned, hypernymed, image alt-text dataset for automatic image cap- tioning,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.04151","last_updated":"2025-07-05T20:16:32Z","snapshot_observed_at":"2026-08-08T10:04:41.494252Z","submitted_at":"2025-07-05T20:16:32Z","title":"Unlocking Compositional Control: Self-Supervision for LVLM-Based Image Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:49.124936Z"},"links":{"citing_paper":"/paper/2507.04151"},"observation_digest":"sha256:80fb5220da2f260e18fa2fa6cbc701b56407653be25e66113b8147e75cdd7c14","observation_id":"a64bd966-0714-446e-baf7-df3e2de89e81","resolution":{"observed_at":"2026-08-06T20:01:49.124936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:49.182156Z","title":"Microsoft COCO: common objects in context,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.04151","last_updated":"2025-07-05T20:16:32Z","snapshot_observed_at":"2026-08-08T10:04:41.494252Z","submitted_at":"2025-07-05T20:16:32Z","title":"Unlocking Compositional Control: Self-Supervision for LVLM-Based Image Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:49.182156Z"},"links":{"citing_paper":"/paper/2507.04151"},"observation_digest":"sha256:680aee100ef9148d560aaf670598100e7192d90ab68e29f9f4e9b98a64ec6f30","observation_id":"3e983ef3-f2c4-4479-84e6-ed3e42306a8d","resolution":{"observed_at":"2026-08-06T20:01:49.182156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:49.238458Z","title":"Beyond empathy: Integrating diagnostic and therapeutic reasoning with large language models for mental health counseling,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04151","last_updated":"2025-07-05T20:16:32Z","snapshot_observed_at":"2026-08-08T10:04:41.494252Z","submitted_at":"2025-07-05T20:16:32Z","title":"Unlocking Compositional Control: Self-Supervision for LVLM-Based Image Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:49.238458Z"},"links":{"citing_paper":"/paper/2507.04151"},"observation_digest":"sha256:f1193683d4a4cab557d997ae9701fc581dbbf8111f702d2aa902ce63f6de36c1","observation_id":"b51647f4-05da-472d-8aa9-a3e55bbafaea","resolution":{"observed_at":"2026-08-06T20:01:49.238458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:51.984888Z","title":"Multimodal event transformer for image-guided story ending generation,","venue":null,"work_id":"b6cc9ed1-7565-4396-a2cc-bf43803829e7","year":2023},"citing_paper":{"arxiv_id":"2507.04151","last_updated":"2025-07-05T20:16:32Z","snapshot_observed_at":"2026-08-08T10:04:41.494252Z","submitted_at":"2025-07-05T20:16:32Z","title":"Unlocking Compositional Control: Self-Supervision for LVLM-Based Image Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:49.291914Z"},"links":{"citing_paper":"/paper/2507.04151"},"observation_digest":"sha256:94a3291e6c57e99b0d415896dbf85c0dad0fbacde76f9087f2c63e6786c4eb00","observation_id":"c4bb82b5-5d46-4de5-a61e-31fa8521f3f0","resolution":{"observed_at":"2026-08-06T20:01:51.987595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:51.976575Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":"aca53972-1ced-4f10-8dea-5c11298d7547","year":2021},"citing_paper":{"arxiv_id":"2507.04151","last_updated":"2025-07-05T20:16:32Z","snapshot_observed_at":"2026-08-08T10:04:41.494252Z","submitted_at":"2025-07-05T20:16:32Z","title":"Unlocking Compositional Control: Self-Supervision for LVLM-Based Image Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:49.346212Z"},"links":{"citing_paper":"/paper/2507.04151"},"observation_digest":"sha256:1a9f21d66cf389833dc570c4990fc53a1f62f57dfb028021e9a7c43591bff600","observation_id":"52b8e76b-5685-4a07-9ed3-d7699c55c7d8","resolution":{"observed_at":"2026-08-06T20:01:51.979779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:49.415102Z","title":"Language models with image descriptors are strong few- shot video-language learners,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.04151","last_updated":"2025-07-05T20:16:32Z","snapshot_observed_at":"2026-08-08T10:04:41.494252Z","submitted_at":"2025-07-05T20:16:32Z","title":"Unlocking Compositional Control: Self-Supervision for LVLM-Based Image Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:49.415102Z"},"links":{"citing_paper":"/paper/2507.04151"},"observation_digest":"sha256:dcb75e8493fa87ddf2d3be890853cebfe01e062b1f84c8ccf325c350ab84ae6b","observation_id":"303dce78-eb93-4e1d-af3f-46553e5732e9","resolution":{"observed_at":"2026-08-06T20:01:49.415102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:49.477464Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.04151","last_updated":"2025-07-05T20:16:32Z","snapshot_observed_at":"2026-08-08T10:04:41.494252Z","submitted_at":"2025-07-05T20:16:32Z","title":"Unlocking Compositional Control: Self-Supervision for LVLM-Based Image Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:49.477464Z"},"links":{"citing_paper":"/paper/2507.04151"},"observation_digest":"sha256:bf6e5d832c2c83e2d2041087194db3ebdee7c0b3df2366357016c49801877bfb","observation_id":"e2b9ee77-6052-4fa3-a5ca-aa9cdc7d36a8","resolution":{"observed_at":"2026-08-06T20:01:49.477464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:49.537759Z","title":"BLIP: bootstrapping language-image pre-training for unified vision-language understanding and generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.04151","last_updated":"2025-07-05T20:16:32Z","snapshot_observed_at":"2026-08-08T10:04:41.494252Z","submitted_at":"2025-07-05T20:16:32Z","title":"Unlocking Compositional Control: Self-Supervision for LVLM-Based Image Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:49.537759Z"},"links":{"citing_paper":"/paper/2507.04151"},"observation_digest":"sha256:5b15d939979e4474f5d9febab473cb899a35ceb312489e873b1adb899c3b9ccd","observation_id":"f6b2fe0d-0c95-403f-b6f8-29463105be68","resolution":{"observed_at":"2026-08-06T20:01:49.537759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:51.947729Z","title":"Flamingo: a visual language model for few-shot learning,","venue":null,"work_id":"5a8009c4-0439-4be7-b139-344118c0f501","year":2022},"citing_paper":{"arxiv_id":"2507.04151","last_updated":"2025-07-05T20:16:32Z","snapshot_observed_at":"2026-08-08T10:04:41.494252Z","submitted_at":"2025-07-05T20:16:32Z","title":"Unlocking Compositional Control: Self-Supervision for LVLM-Based Image Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:49.665137Z"},"links":{"citing_paper":"/paper/2507.04151"},"observation_digest":"sha256:f562855ddb637abff93a90450db80c721345e264743c89b17dd27e4ae75d5ea1","observation_id":"11c69b06-b6ac-46c8-b741-6f2949ee603e","resolution":{"observed_at":"2026-08-06T20:01:51.950631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:51.930961Z","title":"Cross-lingual transfer of large language model by visually- derived supervision toward low-resource languages,","venue":null,"work_id":"7c922bb0-36fc-41d8-8394-69e86b2da831","year":2023},"citing_paper":{"arxiv_id":"2507.04151","last_updated":"2025-07-05T20:16:32Z","snapshot_observed_at":"2026-08-08T10:04:41.494252Z","submitted_at":"2025-07-05T20:16:32Z","title":"Unlocking Compositional Control: Self-Supervision for LVLM-Based Image Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:49.777370Z"},"links":{"citing_paper":"/paper/2507.04151"},"observation_digest":"sha256:5e1a9fd1f07c38787f3d9e5f49c86819d4b514b360d887c14961b413507877c0","observation_id":"c8d1758d-90c1-4e67-b954-f884343bde56","resolution":{"observed_at":"2026-08-06T20:01:51.933684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:49.857465Z","title":"Coca: Contrastive captioners are image-text foundation models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.04151","last_updated":"2025-07-05T20:16:32Z","snapshot_observed_at":"2026-08-08T10:04:41.494252Z","submitted_at":"2025-07-05T20:16:32Z","title":"Unlocking Compositional Control: Self-Supervision for LVLM-Based Image Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:49.857465Z"},"links":{"citing_paper":"/paper/2507.04151"},"observation_digest":"sha256:e11e9175f1984e9a13338f451bb3a99e70f77ecc76bdd3c820a6b53b12d0500b","observation_id":"bbb1fff5-f82a-4315-a287-ce1fe51623f6","resolution":{"observed_at":"2026-08-06T20:01:49.857465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:49.932790Z","title":"Tx-llava: Large language and vision assistant for temporal changes in chest x-rays,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04151","last_updated":"2025-07-05T20:16:32Z","snapshot_observed_at":"2026-08-08T10:04:41.494252Z","submitted_at":"2025-07-05T20:16:32Z","title":"Unlocking Compositional Control: Self-Supervision for LVLM-Based Image Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:49.932790Z"},"links":{"citing_paper":"/paper/2507.04151"},"observation_digest":"sha256:d899c066edce8812bc0cb25b860c5d07d66eb9cb85b36dd6ca07cf3daf35f9b3","observation_id":"8a8f4c49-5753-4a90-8d2b-349c24d96839","resolution":{"observed_at":"2026-08-06T20:01:49.932790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19835","last_updated":"2025-06-24T17:52:43Z","snapshot_observed_at":"2026-08-06T22:59:26.083658Z","submitted_at":"2025-06-24T17:52:43Z","title":"MAM: Modular Multi-Agent Framework for Multi-Modal Medical Diagnosis via Role-Specialized Collaboration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19835","snapshot_observed_at":"2026-08-06T20:01:49.990147Z","title":"Mam: Modular multi-agent framework for multi-modal medical diagnosis via role-specialized collaboration,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04151","last_updated":"2025-07-05T20:16:32Z","snapshot_observed_at":"2026-08-08T10:04:41.494252Z","submitted_at":"2025-07-05T20:16:32Z","title":"Unlocking Compositional Control: Self-Supervision for LVLM-Based Image Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:49.990147Z"},"links":{"cited_paper":"/paper/2506.19835","citing_paper":"/paper/2507.04151"},"observation_digest":"sha256:126988d2a01eefc9f7caa3bc889dc0c9b4d20a7d1b0c1790b7e850a902b86bb4","observation_id":"c0f02167-b11d-450b-84ee-efd249df8742","resolution":{"observed_at":"2026-08-06T20:01:49.990147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:51.916251Z","title":"GLIDE: towards photorealistic image generation and editing with text-guided diffusion models,","venue":null,"work_id":"13cdebf5-d646-4c52-8c52-84446c92643d","year":2022},"citing_paper":{"arxiv_id":"2507.04151","last_updated":"2025-07-05T20:16:32Z","snapshot_observed_at":"2026-08-08T10:04:41.494252Z","submitted_at":"2025-07-05T20:16:32Z","title":"Unlocking Compositional Control: Self-Supervision for LVLM-Based Image Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:50.130327Z"},"links":{"citing_paper":"/paper/2507.04151"},"observation_digest":"sha256:55bdc9d1cf2bee7f9a5a341b4c1e0cfbdf204aa5c590608bed958c1066f39d9e","observation_id":"862c957f-faa2-484a-8d51-e71cc023b4db","resolution":{"observed_at":"2026-08-06T20:01:51.919344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:51.907783Z","title":"Taming transformers for high-resolution image synthesis,","venue":null,"work_id":"94e6833d-dfc0-463b-bc87-845ef785d88c","year":2021},"citing_paper":{"arxiv_id":"2507.04151","last_updated":"2025-07-05T20:16:32Z","snapshot_observed_at":"2026-08-08T10:04:41.494252Z","submitted_at":"2025-07-05T20:16:32Z","title":"Unlocking Compositional Control: Self-Supervision for LVLM-Based Image Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:50.236512Z"},"links":{"citing_paper":"/paper/2507.04151"},"observation_digest":"sha256:11f5abc08b6cd9ba8d769d3cc16cb284b183a9a62e447c942fd0564a7de8591f","observation_id":"297a636c-188f-4afa-b695-eec47deb6d44","resolution":{"observed_at":"2026-08-06T20:01:51.910644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-06T20:01:50.429219Z","title":"Hierarchical text-conditional image generation with CLIP latents,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.04151","last_updated":"2025-07-05T20:16:32Z","snapshot_observed_at":"2026-08-08T10:04:41.494252Z","submitted_at":"2025-07-05T20:16:32Z","title":"Unlocking Compositional Control: Self-Supervision for LVLM-Based Image Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:50.429219Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2507.04151"},"observation_digest":"sha256:b3b830ff739cdc74f2947eecbb929abb505dc27678a8d8beaca6d49d75a6e874","observation_id":"58fbf2b1-988a-45fb-aa34-34272b0e1b4e","resolution":{"observed_at":"2026-08-06T20:01:50.429219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:51.721707Z","title":"BLIP-2: bootstrapping language-image pre-training with frozen image encoders and large language models,","venue":null,"work_id":"818cb7bd-0562-4266-8837-002d6f0c995d","year":2023},"citing_paper":{"arxiv_id":"2507.04151","last_updated":"2025-07-05T20:16:32Z","snapshot_observed_at":"2026-08-08T10:04:41.494252Z","submitted_at":"2025-07-05T20:16:32Z","title":"Unlocking Compositional Control: Self-Supervision for LVLM-Based Image Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:50.532097Z"},"links":{"citing_paper":"/paper/2507.04151"},"observation_digest":"sha256:6c956d217bf06f94dbf750396ddef1f0a9f71031ff91c60704c0b5cdd4b9f653","observation_id":"c9bfb984-33e0-4f54-a912-407aa9600c49","resolution":{"observed_at":"2026-08-06T20:01:51.891777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.16763","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:51.071418Z","title":"Self-rewarding large vision- language models for optimizing prompts in text-to-image generation,","venue":null,"work_id":"33262bf4-3d36-4f26-ae42-bfb4832c9d1f","year":2025},"citing_paper":{"arxiv_id":"2507.04151","last_updated":"2025-07-05T20:16:32Z","snapshot_observed_at":"2026-08-08T10:04:41.494252Z","submitted_at":"2025-07-05T20:16:32Z","title":"Unlocking Compositional Control: Self-Supervision for LVLM-Based Image Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:50.623402Z"},"links":{"citing_paper":"/paper/2507.04151"},"observation_digest":"sha256:5599823dfa1ce590d2ea679e037eab5c92569e41f8e97cc1310afb567f75fe68","observation_id":"23f68944-0b40-4f1c-8bc8-6956db206c4c","resolution":{"observed_at":"2026-08-06T20:01:51.120901Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:51.526445Z","title":"Evolvedirector: Approaching advanced text-to-image generation with large vision- language models,","venue":null,"work_id":"8121b739-4881-49f9-af16-22d1613650e0","year":2024},"citing_paper":{"arxiv_id":"2507.04151","last_updated":"2025-07-05T20:16:32Z","snapshot_observed_at":"2026-08-08T10:04:41.494252Z","submitted_at":"2025-07-05T20:16:32Z","title":"Unlocking Compositional Control: Self-Supervision for LVLM-Based Image Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:50.782997Z"},"links":{"citing_paper":"/paper/2507.04151"},"observation_digest":"sha256:a7379eb8ee13788d0b2ec961ef099f2c7efc1a4d0a47ee7db12815b97d8c1c43","observation_id":"a03b9272-b4da-457a-93c2-b024dea37138","resolution":{"observed_at":"2026-08-06T20:01:51.618270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06311","last_updated":"2023-10-10T05:09:05Z","snapshot_observed_at":"2026-08-09T20:27:52.493255Z","submitted_at":"2023-10-10T05:09:05Z","title":"Improving Compositional Text-to-image Generation with Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06311","snapshot_observed_at":"2026-08-06T20:01:50.856287Z","title":"Improving compositional text-to-image generation with large vision-language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04151","last_updated":"2025-07-05T20:16:32Z","snapshot_observed_at":"2026-08-08T10:04:41.494252Z","submitted_at":"2025-07-05T20:16:32Z","title":"Unlocking Compositional Control: Self-Supervision for LVLM-Based Image Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:50.856287Z"},"links":{"cited_paper":"/paper/2310.06311","citing_paper":"/paper/2507.04151"},"observation_digest":"sha256:14b77a15b11e732674cf72d6e7764bd4aef97c5c742c545247847d7d59ba1bbd","observation_id":"d773c6ae-7ce0-4acc-90e3-fc520c889a19","resolution":{"observed_at":"2026-08-06T20:01:50.856287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:49.603500Z","title":"12 888–12 900","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.04151","last_updated":"2025-07-05T20:16:32Z","snapshot_observed_at":"2026-08-08T10:04:41.494252Z","submitted_at":"2025-07-05T20:16:32Z","title":"Unlocking Compositional Control: Self-Supervision for LVLM-Based Image Generation","version":1},"reference_index":162,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:49.603500Z"},"links":{"citing_paper":"/paper/2507.04151"},"observation_digest":"sha256:261be0c0786614e1bbbec07d0b7f17d0f49c93a76b0e592a66e6f47c50f23bfe","observation_id":"ce90422c-0cd8-4b94-aee9-40bbe469c126","resolution":{"observed_at":"2026-08-06T20:01:49.603500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:51.898228Z","title":"12 873–12 883","venue":null,"work_id":"457dd389-0c84-44d5-b5b6-9e5396b4ac4a","year":2021},"citing_paper":{"arxiv_id":"2507.04151","last_updated":"2025-07-05T20:16:32Z","snapshot_observed_at":"2026-08-08T10:04:41.494252Z","submitted_at":"2025-07-05T20:16:32Z","title":"Unlocking Compositional Control: Self-Supervision for LVLM-Based Image Generation","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:50.329073Z"},"links":{"citing_paper":"/paper/2507.04151"},"observation_digest":"sha256:629bbf58a37f079076956abcc930d100737a1539e3c4a68528042378917558fa","observation_id":"36bc1f5d-8b4d-4268-81a7-3680fabc8de5","resolution":{"observed_at":"2026-08-06T20:01:51.901437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:51.939641Z","title":"Available: http://papers.nips.cc/paper\\ files/paper/2022/ hash/960a172bc7fbf0177ccccbb411a7d800-Abstract-Conference.html 11","venue":null,"work_id":"984d36f9-5d72-452f-9a1f-1e17d9910e92","year":2022},"citing_paper":{"arxiv_id":"2507.04151","last_updated":"2025-07-05T20:16:32Z","snapshot_observed_at":"2026-08-08T10:04:41.494252Z","submitted_at":"2025-07-05T20:16:32Z","title":"Unlocking Compositional Control: Self-Supervision for LVLM-Based Image Generation","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:49.714980Z"},"links":{"citing_paper":"/paper/2507.04151"},"observation_digest":"sha256:e06dd58afcd6b74e34eb6e5e7f0345013e13d818b164ce397d5e2b5d2d7edad0","observation_id":"e42b8339-0647-416f-ab6f-96e8422d85ea","resolution":{"observed_at":"2026-08-06T20:01:51.942532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.04151","last_updated":"2025-07-05T20:16:32Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T10:04:41.494252Z","submitted_at":"2025-07-05T20:16:32Z","title":"Unlocking Compositional Control: Self-Supervision for LVLM-Based Image Generation"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":1,"verified_fuzzy":12},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 0 inbound Pith citation observations for arXiv:2507.04151."}