{"as_of":"2026-08-09T15:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2d63a92c9131965389370eba8a9d580e749bc7501d3dc9d00f58705119d4d4bf","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:58:05.710909Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.04152/citation-record","integrity":"/paper/2507.04152/integrity","json":"/paper/2507.04152/citation-record.json","paper":"/paper/2507.04152"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:58:01.645874Z","title":"Less is more: Vision representation compression for efficient video generation with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04152","last_updated":"2025-07-05T20:21:03Z","snapshot_observed_at":"2026-08-08T00:54:54.624012Z","submitted_at":"2025-07-05T20:21:03Z","title":"LVLM-Composer's Explicit Planning for Image Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T19:58:01.645874Z"},"links":{"citing_paper":"/paper/2507.04152"},"observation_digest":"sha256:cde1168ae5e5ba5dafe3d09d9c1d3e8a7455461bc337b60e2789c1433cc4e265","observation_id":"24e861b9-5e24-4d5c-b14f-c57bdddf08a3","resolution":{"observed_at":"2026-08-06T19:58:01.645874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17811","snapshot_observed_at":"2026-08-06T19:58:01.720824Z","title":"Janus-pro: Unified multimodal understanding and generation with data and model scaling,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04152","last_updated":"2025-07-05T20:21:03Z","snapshot_observed_at":"2026-08-08T00:54:54.624012Z","submitted_at":"2025-07-05T20:21:03Z","title":"LVLM-Composer's Explicit Planning for Image Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T19:58:01.720824Z"},"links":{"cited_paper":"/paper/2501.17811","citing_paper":"/paper/2507.04152"},"observation_digest":"sha256:16e9f1f00ab78c4ecf488603583f4e41ee9669ea3a3d8b921debbff84468b321","observation_id":"bd2cd77b-15f5-4468-8e93-83283b1ebdde","resolution":{"observed_at":"2026-08-06T19:58:01.720824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24787","last_updated":"2025-05-30T16:48:14Z","snapshot_observed_at":"2026-08-07T15:30:21.145991Z","submitted_at":"2025-05-30T16:48:14Z","title":"Draw ALL Your Imagine: A Holistic Benchmark and Agent Framework for Complex Instruction-based Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24787","snapshot_observed_at":"2026-08-06T19:58:01.777284Z","title":"Draw all your imagine: A holistic benchmark and agent framework for complex instruction-based image generation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04152","last_updated":"2025-07-05T20:21:03Z","snapshot_observed_at":"2026-08-08T00:54:54.624012Z","submitted_at":"2025-07-05T20:21:03Z","title":"LVLM-Composer's Explicit Planning for Image Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T19:58:01.777284Z"},"links":{"cited_paper":"/paper/2505.24787","citing_paper":"/paper/2507.04152"},"observation_digest":"sha256:166dda54c02e6c67d227c088a34e7a6a0a30b30e017cb71a52f39bb189eced49","observation_id":"21eb0ce8-b794-4f5c-af95-7c5121abd867","resolution":{"observed_at":"2026-08-06T19:58:01.777284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.12830","last_updated":"2025-06-15T12:22:55Z","snapshot_observed_at":"2026-08-09T11:19:36.846193Z","submitted_at":"2025-06-15T12:22:55Z","title":"ComplexBench-Edit: Benchmarking Complex Instruction-Driven Image Editing via Compositional Dependencies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.12830","snapshot_observed_at":"2026-08-06T19:58:01.897972Z","title":"Complexbench- edit: Benchmarking complex instruction-driven image editing via com- positional dependencies,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04152","last_updated":"2025-07-05T20:21:03Z","snapshot_observed_at":"2026-08-08T00:54:54.624012Z","submitted_at":"2025-07-05T20:21:03Z","title":"LVLM-Composer's Explicit Planning for Image Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T19:58:01.897972Z"},"links":{"cited_paper":"/paper/2506.12830","citing_paper":"/paper/2507.04152"},"observation_digest":"sha256:182e41fd99ec5e34617c52d317d1cab9100350d753185648144ef75f588af555","observation_id":"054b8275-6e6b-4a44-b369-6d7e14b4fa48","resolution":{"observed_at":"2026-08-06T19:58:01.897972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:58:02.079218Z","title":"Weak to strong generalization for large language models with multi-capabilities,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04152","last_updated":"2025-07-05T20:21:03Z","snapshot_observed_at":"2026-08-08T00:54:54.624012Z","submitted_at":"2025-07-05T20:21:03Z","title":"LVLM-Composer's Explicit Planning for Image Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T19:58:02.079218Z"},"links":{"citing_paper":"/paper/2507.04152"},"observation_digest":"sha256:91cf66d13babe9eb409a6e939c26947c21585577b9acc95e6183144d643f150e","observation_id":"32798ebe-4040-4612-baa4-705948485c0f","resolution":{"observed_at":"2026-08-06T19:58:02.079218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12432","last_updated":"2025-05-25T13:59:04Z","snapshot_observed_at":"2026-08-07T08:09:08.223198Z","submitted_at":"2025-01-21T16:49:08Z","title":"Divide-Then-Aggregate: An Efficient Tool Learning Method via Parallel Tool Invocation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12432","snapshot_observed_at":"2026-08-06T19:58:02.300391Z","title":"Divide-then-aggregate: An efficient tool learning method via parallel tool invocation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04152","last_updated":"2025-07-05T20:21:03Z","snapshot_observed_at":"2026-08-08T00:54:54.624012Z","submitted_at":"2025-07-05T20:21:03Z","title":"LVLM-Composer's Explicit Planning for Image Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T19:58:02.300391Z"},"links":{"cited_paper":"/paper/2501.12432","citing_paper":"/paper/2507.04152"},"observation_digest":"sha256:28477e6f45d21bb3fd714541eaa3a79d12b7350f4d752b8b293de1bb1ba5c05a","observation_id":"41fc1007-da5b-4686-a218-a3d82559baac","resolution":{"observed_at":"2026-08-06T19:58:02.300391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08734","last_updated":"2023-11-15T06:54:44Z","snapshot_observed_at":"2026-08-06T23:57:01.440666Z","submitted_at":"2023-11-15T06:54:44Z","title":"Thread of Thought Unraveling Chaotic Contexts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08734","snapshot_observed_at":"2026-08-06T19:58:02.468597Z","title":"Thread of thought unraveling chaotic contexts,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04152","last_updated":"2025-07-05T20:21:03Z","snapshot_observed_at":"2026-08-08T00:54:54.624012Z","submitted_at":"2025-07-05T20:21:03Z","title":"LVLM-Composer's Explicit Planning for Image Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T19:58:02.468597Z"},"links":{"cited_paper":"/paper/2311.08734","citing_paper":"/paper/2507.04152"},"observation_digest":"sha256:7f84c32fe6b7dee1c5883acf1ec9900cb96ffc472311cfacbf92e451c9313da2","observation_id":"1365ae65-0aae-44aa-870f-f3af36727cbd","resolution":{"observed_at":"2026-08-06T19:58:02.468597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:58:07.959066Z","title":"Hierarchical reinforcement learning for handling sparse rewards in multi-goal navigation,","venue":null,"work_id":"df72170e-596b-41e2-80a6-1af36db1dedf","year":2024},"citing_paper":{"arxiv_id":"2507.04152","last_updated":"2025-07-05T20:21:03Z","snapshot_observed_at":"2026-08-08T00:54:54.624012Z","submitted_at":"2025-07-05T20:21:03Z","title":"LVLM-Composer's Explicit Planning for Image Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T19:58:02.608469Z"},"links":{"citing_paper":"/paper/2507.04152"},"observation_digest":"sha256:86e33a3e5840616c7e098c4185068e39288352fffa0507e40b5f6fac43212ee9","observation_id":"0b17ec1a-4b49-4687-8b59-22e9adaa2801","resolution":{"observed_at":"2026-08-06T19:58:08.041512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.07818","last_updated":"2022-08-16T16:07:05Z","snapshot_observed_at":"2026-07-06T13:42:24.750714Z","submitted_at":"2022-08-16T16:07:05Z","title":"Training Latent Variable Models with Auto-encoding Variational Bayes: A Tutorial","version":1},"cited_work":{"arxiv_id":"2208.07818","doi":"10.48550/arxiv.2208.07818","metadata_source":"pith","pith_arxiv_id":"2208.07818","snapshot_observed_at":"2026-08-07T06:16:28.064256Z","title":"Training Latent Variable Models with Auto-encoding Variational Bayes: A Tutorial","venue":"cs.LG","work_id":"553b1d40-a3a6-44cd-97ea-fa1328aa79b1","year":2022},"citing_paper":{"arxiv_id":"2507.04152","last_updated":"2025-07-05T20:21:03Z","snapshot_observed_at":"2026-08-08T00:54:54.624012Z","submitted_at":"2025-07-05T20:21:03Z","title":"LVLM-Composer's Explicit Planning for Image Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T19:58:02.725421Z"},"links":{"cited_paper":"/paper/2208.07818","citing_paper":"/paper/2507.04152"},"observation_digest":"sha256:3413c8ca370e2136c9a55d12b7b14a73b1b2245ee77a5a156e740ebf14f8fc94","observation_id":"a915607f-1aca-4343-b396-04f7df7932c0","resolution":{"observed_at":"2026-08-06T19:58:06.318947Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.07793","last_updated":"2020-02-07T18:11:58Z","snapshot_observed_at":"2026-07-06T07:46:31.893420Z","submitted_at":"2019-04-16T16:26:19Z","title":"AT-GAN: An Adversarial Generator Model for Non-constrained Adversarial Examples","version":4},"cited_work":{"arxiv_id":"1904.07793","doi":null,"metadata_source":"pith","pith_arxiv_id":"1904.07793","snapshot_observed_at":"2026-08-06T19:58:07.357831Z","title":"AT-GAN: An Adversarial Generator Model for Non-constrained Adversarial Examples","venue":"cs.CV","work_id":"c179a5ff-d401-4c6b-a7f6-7fc9e3b83d1a","year":2019},"citing_paper":{"arxiv_id":"2507.04152","last_updated":"2025-07-05T20:21:03Z","snapshot_observed_at":"2026-08-08T00:54:54.624012Z","submitted_at":"2025-07-05T20:21:03Z","title":"LVLM-Composer's Explicit Planning for Image Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T19:58:02.846209Z"},"links":{"cited_paper":"/paper/1904.07793","citing_paper":"/paper/2507.04152"},"observation_digest":"sha256:37f2477e6b6a8f9609dda59a56b812af7dfac8f8ae87a7305d7e086bd53c8d9e","observation_id":"b8063857-6afa-433f-a5f5-9f827a0a859d","resolution":{"observed_at":"2026-08-06T19:58:07.424502Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:58:07.844292Z","title":"Progressive growing of gans for improved quality, stability, and variation,","venue":null,"work_id":"0a65d054-ef97-48c2-80eb-5a1472c8b59e","year":2018},"citing_paper":{"arxiv_id":"2507.04152","last_updated":"2025-07-05T20:21:03Z","snapshot_observed_at":"2026-08-08T00:54:54.624012Z","submitted_at":"2025-07-05T20:21:03Z","title":"LVLM-Composer's Explicit Planning for Image Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T19:58:02.990587Z"},"links":{"citing_paper":"/paper/2507.04152"},"observation_digest":"sha256:70e6f180e5b49fa2698bc56b22a5fca2448fe7c7193f0c07151b28716a4b1606","observation_id":"bbccaa72-c661-4b23-8a95-7325dcaa7de9","resolution":{"observed_at":"2026-08-06T19:58:07.885775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:58:03.146784Z","title":"Unpaired image-to-image translation using cycle-consistent adversarial networks,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.04152","last_updated":"2025-07-05T20:21:03Z","snapshot_observed_at":"2026-08-08T00:54:54.624012Z","submitted_at":"2025-07-05T20:21:03Z","title":"LVLM-Composer's Explicit Planning for Image Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T19:58:03.146784Z"},"links":{"citing_paper":"/paper/2507.04152"},"observation_digest":"sha256:0aca589a459b1903acd477317446b54d0dea764f002a2f85a7d7e048da5047f7","observation_id":"f15cd496-2cbc-41f8-b3a0-33f4a0c5b42d","resolution":{"observed_at":"2026-08-06T19:58:03.146784Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2024.34050","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:58:06.760128Z","title":"Wrapped phase denoising using denoising diffusion probabilistic models,","venue":null,"work_id":"a774bb44-8cf8-4157-963f-bf88e2d9d448","year":2024},"citing_paper":{"arxiv_id":"2507.04152","last_updated":"2025-07-05T20:21:03Z","snapshot_observed_at":"2026-08-08T00:54:54.624012Z","submitted_at":"2025-07-05T20:21:03Z","title":"LVLM-Composer's Explicit Planning for Image Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T19:58:03.245760Z"},"links":{"citing_paper":"/paper/2507.04152"},"observation_digest":"sha256:0adc0ab398d84cc19be056b94b18125778f9eab68fd40c639185c28736f17211","observation_id":"0a9ed52f-6c7c-4c57-b43b-03abfe0f0bf6","resolution":{"observed_at":"2026-08-06T19:58:07.171960Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2503.18352","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:58:05.948131Z","title":"Diffusion-4k: Ultra-high-resolution image synthesis with latent diffusion models,","venue":null,"work_id":"0c5d5d48-982e-4015-a4ef-18a96ae6eeb9","year":2025},"citing_paper":{"arxiv_id":"2507.04152","last_updated":"2025-07-05T20:21:03Z","snapshot_observed_at":"2026-08-08T00:54:54.624012Z","submitted_at":"2025-07-05T20:21:03Z","title":"LVLM-Composer's Explicit Planning for Image Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T19:58:03.368276Z"},"links":{"citing_paper":"/paper/2507.04152"},"observation_digest":"sha256:46417f89b5c38ad5cc138162dce1edb56ed49b1f9b138132c8cb151ef7a3712e","observation_id":"4a3db813-1076-4c35-9802-5e7b85d283d0","resolution":{"observed_at":"2026-08-06T19:58:06.084601Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:58:03.546204Z","title":"Photorealistic text-to-image diffusion models with deep language understanding,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.04152","last_updated":"2025-07-05T20:21:03Z","snapshot_observed_at":"2026-08-08T00:54:54.624012Z","submitted_at":"2025-07-05T20:21:03Z","title":"LVLM-Composer's Explicit Planning for Image Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T19:58:03.546204Z"},"links":{"citing_paper":"/paper/2507.04152"},"observation_digest":"sha256:ee0fbd62917ecab61ec3b405b1d43adaeb137d5886e46ae16400ecc0b3a2631c","observation_id":"84253ed0-da30-4925-a238-d56d8b0b0521","resolution":{"observed_at":"2026-08-06T19:58:03.546204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:58:03.698375Z","title":"Masked autoencoders are scalable vision learners,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.04152","last_updated":"2025-07-05T20:21:03Z","snapshot_observed_at":"2026-08-08T00:54:54.624012Z","submitted_at":"2025-07-05T20:21:03Z","title":"LVLM-Composer's Explicit Planning for Image Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T19:58:03.698375Z"},"links":{"citing_paper":"/paper/2507.04152"},"observation_digest":"sha256:e8fa1d6a9d38113a13c616bf904edc96ed9b5a996e1faef099e39ad52b94cc33","observation_id":"978225b2-86ff-4309-a5d0-29f1faac460e","resolution":{"observed_at":"2026-08-06T19:58:03.698375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:58:03.794578Z","title":"Improving cross-modal alignment for text- guided image inpainting,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04152","last_updated":"2025-07-05T20:21:03Z","snapshot_observed_at":"2026-08-08T00:54:54.624012Z","submitted_at":"2025-07-05T20:21:03Z","title":"LVLM-Composer's Explicit Planning for Image Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T19:58:03.794578Z"},"links":{"citing_paper":"/paper/2507.04152"},"observation_digest":"sha256:f0157b02c35ccf5ab24a745e75bbd57219d30b82c5b29ea805c796a13ae9d0d5","observation_id":"5e74baa5-ad98-4b2e-ab48-5e18f78c046c","resolution":{"observed_at":"2026-08-06T19:58:03.794578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01377","last_updated":"2025-06-02T09:56:36Z","snapshot_observed_at":"2026-08-06T08:18:28.668841Z","submitted_at":"2025-01-02T17:37:20Z","title":"Improving Medical Large Vision-Language Models with Abnormal-Aware Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01377","snapshot_observed_at":"2026-08-06T19:58:03.938240Z","title":"Training medical large vision- language models with abnormal-aware feedback,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04152","last_updated":"2025-07-05T20:21:03Z","snapshot_observed_at":"2026-08-08T00:54:54.624012Z","submitted_at":"2025-07-05T20:21:03Z","title":"LVLM-Composer's Explicit Planning for Image Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T19:58:03.938240Z"},"links":{"cited_paper":"/paper/2501.01377","citing_paper":"/paper/2507.04152"},"observation_digest":"sha256:002a2c4a9dd2acf07c5ee866b8a29c61eae6b4a7232a319bc65e101ba5d8f629","observation_id":"1ed7a406-62f0-4de9-8b3a-a1ee0a56717b","resolution":{"observed_at":"2026-08-06T19:58:03.938240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:58:04.039751Z","title":"Vilbert: Pretraining task-agnostic visiolinguistic representations for vision-and-language tasks,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.04152","last_updated":"2025-07-05T20:21:03Z","snapshot_observed_at":"2026-08-08T00:54:54.624012Z","submitted_at":"2025-07-05T20:21:03Z","title":"LVLM-Composer's Explicit Planning for Image Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T19:58:04.039751Z"},"links":{"citing_paper":"/paper/2507.04152"},"observation_digest":"sha256:acb9add1b663a8e7f8cd30313b9a8f4ad9b642ffa7b9d705e2bc70edbec67f4a","observation_id":"499d3422-1ebd-486c-bcdf-e5d7068012e7","resolution":{"observed_at":"2026-08-06T19:58:04.039751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03557","last_updated":"2019-08-09T17:57:13Z","snapshot_observed_at":"2026-08-07T01:39:40.489262Z","submitted_at":"2019-08-09T17:57:13Z","title":"VisualBERT: A Simple and Performant Baseline for Vision and Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.03557","snapshot_observed_at":"2026-08-06T19:58:04.104937Z","title":"Visualbert: A simple and performant baseline for vision and language,","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2507.04152","last_updated":"2025-07-05T20:21:03Z","snapshot_observed_at":"2026-08-08T00:54:54.624012Z","submitted_at":"2025-07-05T20:21:03Z","title":"LVLM-Composer's Explicit Planning for Image Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T19:58:04.104937Z"},"links":{"cited_paper":"/paper/1908.03557","citing_paper":"/paper/2507.04152"},"observation_digest":"sha256:050973505dfcfa9bb4726a066bb0001d8928288f36007a88744cfaae1766d4ea","observation_id":"7e7b9a1f-e213-48e4-9b90-8a219cd8f120","resolution":{"observed_at":"2026-08-06T19:58:04.104937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:58:04.146702Z","title":"LXMERT: learning cross-modality encoder representations from transformers,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.04152","last_updated":"2025-07-05T20:21:03Z","snapshot_observed_at":"2026-08-08T00:54:54.624012Z","submitted_at":"2025-07-05T20:21:03Z","title":"LVLM-Composer's Explicit Planning for Image Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T19:58:04.146702Z"},"links":{"citing_paper":"/paper/2507.04152"},"observation_digest":"sha256:f2cc5138231ce64a899b0459673a3d4bfb47289240ea3e9485901c5d14396c0f","observation_id":"5e8eeb73-a962-4392-b228-2bb6c6c2f836","resolution":{"observed_at":"2026-08-06T19:58:04.146702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:58:04.269413Z","title":"UNITER: universal image-text representation learning,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.04152","last_updated":"2025-07-05T20:21:03Z","snapshot_observed_at":"2026-08-08T00:54:54.624012Z","submitted_at":"2025-07-05T20:21:03Z","title":"LVLM-Composer's Explicit Planning for Image Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T19:58:04.269413Z"},"links":{"citing_paper":"/paper/2507.04152"},"observation_digest":"sha256:361399d76930e9827e0bb04d7469a7049ba8ab3280fbd326494d66f6e03e2e6b","observation_id":"e7c31312-2bd0-45e9-9f18-a46deaa6b514","resolution":{"observed_at":"2026-08-06T19:58:04.269413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:58:07.654286Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":"aab49435-9d02-49b2-b4d9-cb20f230035d","year":2021},"citing_paper":{"arxiv_id":"2507.04152","last_updated":"2025-07-05T20:21:03Z","snapshot_observed_at":"2026-08-08T00:54:54.624012Z","submitted_at":"2025-07-05T20:21:03Z","title":"LVLM-Composer's Explicit Planning for Image Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T19:58:04.467187Z"},"links":{"citing_paper":"/paper/2507.04152"},"observation_digest":"sha256:b491b8f0c4abbb4ccff5d11438ed5769fc7297dd9d79bda21c17e9d1a46a868a","observation_id":"c15234cd-319a-4739-9e93-7817ad3283c1","resolution":{"observed_at":"2026-08-06T19:58:07.749125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:58:04.673194Z","title":"Interleave-vla: Enhancing robot manipulation with interleaved image-text instructions,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04152","last_updated":"2025-07-05T20:21:03Z","snapshot_observed_at":"2026-08-08T00:54:54.624012Z","submitted_at":"2025-07-05T20:21:03Z","title":"LVLM-Composer's Explicit Planning for Image Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T19:58:04.673194Z"},"links":{"citing_paper":"/paper/2507.04152"},"observation_digest":"sha256:fdaa26b390411555d17dfd27433a6d6505bc09b80e98810aa4c9bdba1163b4e2","observation_id":"99bd6c51-ee5f-4d94-bb95-730fa9ffb1ea","resolution":{"observed_at":"2026-08-06T19:58:04.673194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03963","last_updated":"2024-06-14T03:42:17Z","snapshot_observed_at":"2026-07-06T14:02:32.637793Z","submitted_at":"2022-10-08T08:07:47Z","title":"SDA: Simple Discrete Augmentation for Contrastive Sentence Representation Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03963","snapshot_observed_at":"2026-08-06T19:58:04.807213Z","title":"Sda: simple discrete augmentation for contrastive sentence representation learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.04152","last_updated":"2025-07-05T20:21:03Z","snapshot_observed_at":"2026-08-08T00:54:54.624012Z","submitted_at":"2025-07-05T20:21:03Z","title":"LVLM-Composer's Explicit Planning for Image Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T19:58:04.807213Z"},"links":{"cited_paper":"/paper/2210.03963","citing_paper":"/paper/2507.04152"},"observation_digest":"sha256:d8ece4cce48ad6b013ceb177dd5e4830608815e043f7fbd8faaf4b41d13123de","observation_id":"a18d5673-de44-4be3-89d3-fd2fed68f536","resolution":{"observed_at":"2026-08-06T19:58:04.807213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.11432","snapshot_observed_at":"2026-08-06T19:58:04.995920Z","title":"Florence: A new foundation model for computer vision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.04152","last_updated":"2025-07-05T20:21:03Z","snapshot_observed_at":"2026-08-08T00:54:54.624012Z","submitted_at":"2025-07-05T20:21:03Z","title":"LVLM-Composer's Explicit Planning for Image Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T19:58:04.995920Z"},"links":{"cited_paper":"/paper/2111.11432","citing_paper":"/paper/2507.04152"},"observation_digest":"sha256:228fb561972cf06551eea18dfb397b44b75f577bc05ab7eac1cbf27726b10fb8","observation_id":"6c414907-a55c-4a80-ac8b-b0d78fc63b9c","resolution":{"observed_at":"2026-08-06T19:58:04.995920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:58:07.536563Z","title":"Coca: Contrastive captioners are image-text foundation models,","venue":null,"work_id":"eed53e51-8eae-46d7-9af6-07aa6e4f5d70","year":2022},"citing_paper":{"arxiv_id":"2507.04152","last_updated":"2025-07-05T20:21:03Z","snapshot_observed_at":"2026-08-08T00:54:54.624012Z","submitted_at":"2025-07-05T20:21:03Z","title":"LVLM-Composer's Explicit Planning for Image Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T19:58:05.142667Z"},"links":{"citing_paper":"/paper/2507.04152"},"observation_digest":"sha256:11799c88b720d566f7fd4d8dd5ecb8238bac1b7a25ccb49b6163da2b10136b5f","observation_id":"1d874a5a-7bf3-4e04-870c-719f23f40135","resolution":{"observed_at":"2026-08-06T19:58:07.569594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:58:05.327150Z","title":"Tx-llava: Large language and vision assistant for temporal changes in chest x-rays,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04152","last_updated":"2025-07-05T20:21:03Z","snapshot_observed_at":"2026-08-08T00:54:54.624012Z","submitted_at":"2025-07-05T20:21:03Z","title":"LVLM-Composer's Explicit Planning for Image Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T19:58:05.327150Z"},"links":{"citing_paper":"/paper/2507.04152"},"observation_digest":"sha256:8b3fdc361b4e3311a1b9152936cb26418a43dd8b7119bf34a214b377f0c8ea39","observation_id":"f190b315-f376-478c-b7ee-7d3a5aa52a98","resolution":{"observed_at":"2026-08-06T19:58:05.327150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-06T19:58:05.420033Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04152","last_updated":"2025-07-05T20:21:03Z","snapshot_observed_at":"2026-08-08T00:54:54.624012Z","submitted_at":"2025-07-05T20:21:03Z","title":"LVLM-Composer's Explicit Planning for Image Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T19:58:05.420033Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2507.04152"},"observation_digest":"sha256:37b58b39135b003a4467d15ad48013f1c276a79181be75dc9c693779d6d9964e","observation_id":"607f8bea-edfd-4106-a2e5-7259d5e0d65f","resolution":{"observed_at":"2026-08-06T19:58:05.420033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07398","last_updated":"2024-06-20T14:44:14Z","snapshot_observed_at":"2026-07-06T17:28:43.842260Z","submitted_at":"2024-02-12T04:13:16Z","title":"VisLingInstruct: Elevating Zero-Shot Learning in Multi-Modal Language Models with Autonomous Instruction Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07398","snapshot_observed_at":"2026-08-06T19:58:05.562611Z","title":"Vislinginstruct: Elevating zero-shot learning in multi-modal lan- guage models with autonomous instruction optimization,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04152","last_updated":"2025-07-05T20:21:03Z","snapshot_observed_at":"2026-08-08T00:54:54.624012Z","submitted_at":"2025-07-05T20:21:03Z","title":"LVLM-Composer's Explicit Planning for Image Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T19:58:05.562611Z"},"links":{"cited_paper":"/paper/2402.07398","citing_paper":"/paper/2507.04152"},"observation_digest":"sha256:197a0f83b39584c7128f49fa66ef5d3535f4bf0a4a630883a4ace60880cb33c4","observation_id":"db4e1c6d-90c6-4b13-a17c-7e5d6f8bdaad","resolution":{"observed_at":"2026-08-06T19:58:05.562611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19835","last_updated":"2025-06-24T17:52:43Z","snapshot_observed_at":"2026-08-06T22:59:26.083658Z","submitted_at":"2025-06-24T17:52:43Z","title":"MAM: Modular Multi-Agent Framework for Multi-Modal Medical Diagnosis via Role-Specialized Collaboration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19835","snapshot_observed_at":"2026-08-06T19:58:05.710909Z","title":"Mam: Modular multi-agent framework for multi-modal medical diagnosis via role-specialized collaboration,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04152","last_updated":"2025-07-05T20:21:03Z","snapshot_observed_at":"2026-08-08T00:54:54.624012Z","submitted_at":"2025-07-05T20:21:03Z","title":"LVLM-Composer's Explicit Planning for Image Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T19:58:05.710909Z"},"links":{"cited_paper":"/paper/2506.19835","citing_paper":"/paper/2507.04152"},"observation_digest":"sha256:849c085738a720c6c3dc61b8b032ea531434e067cf6b03949a787e4fc5a33493","observation_id":"682ff5f4-01e0-4636-a69f-8cffd40bb5fe","resolution":{"observed_at":"2026-08-06T19:58:05.710909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.04152","last_updated":"2025-07-05T20:21:03Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T00:54:54.624012Z","submitted_at":"2025-07-05T20:21:03Z","title":"LVLM-Composer's Explicit Planning for Image Generation"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":22,"verified_exact":3,"verified_fuzzy":4},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 0 inbound Pith citation observations for arXiv:2507.04152."}