{"as_of":"2026-08-09T14:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5b361f6b77fb87840afd3783bc95cdb9240ffdadb328faef979551ebe0be67b8","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":12,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":12,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":12,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T05:26:57.014104Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T14:48:32.608389Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.14555","last_updated":"2024-06-20T17:58:52Z","snapshot_observed_at":"2026-08-08T18:59:34.400882Z","submitted_at":"2024-06-20T17:58:52Z","title":"A Survey of Multimodal-Guided Image Editing with Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14555","snapshot_observed_at":"2026-08-08T05:26:57.014104Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08364","last_updated":"2025-08-15T00:20:58Z","snapshot_observed_at":"2026-08-09T07:18:38.581459Z","submitted_at":"2025-02-12T12:50:24Z","title":"A Survey on Pre-Trained Diffusion Model Distillations","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-08T05:26:57.014104Z"},"links":{"cited_paper":"/paper/2406.14555","citing_paper":"/paper/2502.08364"},"observation_digest":"sha256:277b1470591ccb568ac2d89e715466d995da1bc36a7aff5c519f097572ba6947","observation_id":"0e345701-4149-431f-a655-25e323bdb32e","resolution":{"observed_at":"2026-08-08T05:26:57.014104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14555","last_updated":"2024-06-20T17:58:52Z","snapshot_observed_at":"2026-08-08T18:59:34.400882Z","submitted_at":"2024-06-20T17:58:52Z","title":"A Survey of Multimodal-Guided Image Editing with Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14555","snapshot_observed_at":"2026-08-07T15:02:18.230361Z","title":"A survey of multimodal-guided image editing with text-to-image diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16707","last_updated":"2025-05-22T14:08:59Z","snapshot_observed_at":"2026-08-07T22:16:46.041806Z","submitted_at":"2025-05-22T14:08:59Z","title":"KRIS-Bench: Benchmarking Next-Level Intelligent Image Editing Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:18.230361Z"},"links":{"cited_paper":"/paper/2406.14555","citing_paper":"/paper/2505.16707"},"observation_digest":"sha256:0d60107ccb7bc477d2fba6238431da0e3e933272149c5849ce1d5ad809adffdd","observation_id":"878b40ac-f11b-43b7-a642-64d481dac74d","resolution":{"observed_at":"2026-08-07T15:02:18.230361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14555","last_updated":"2024-06-20T17:58:52Z","snapshot_observed_at":"2026-08-08T18:59:34.400882Z","submitted_at":"2024-06-20T17:58:52Z","title":"A Survey of Multimodal-Guided Image Editing with Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14555","snapshot_observed_at":"2026-08-07T12:27:34.712223Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24423","last_updated":"2025-05-30T10:02:15Z","snapshot_observed_at":"2026-08-09T10:43:00.694935Z","submitted_at":"2025-05-30T10:02:15Z","title":"MMAFFBen: A Multilingual and Multimodal Affective Analysis Benchmark for Evaluating LLMs and VLMs","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:34.712223Z"},"links":{"cited_paper":"/paper/2406.14555","citing_paper":"/paper/2505.24423"},"observation_digest":"sha256:f67c50f7d15419bb28b63eaca82dbc060ee339c65085beed410bca6025cb0008","observation_id":"6c2fbbb3-ed15-49b7-9928-5a3138001b26","resolution":{"observed_at":"2026-08-07T12:27:34.712223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14555","last_updated":"2024-06-20T17:58:52Z","snapshot_observed_at":"2026-08-08T18:59:34.400882Z","submitted_at":"2024-06-20T17:58:52Z","title":"A Survey of Multimodal-Guided Image Editing with Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14555","snapshot_observed_at":"2026-08-06T20:25:27.267209Z","title":"A survey of multimodal-guided image editing with text-to-image diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-09T00:50:03.032034Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:27.267209Z"},"links":{"cited_paper":"/paper/2406.14555","citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:948ccfbc76b64d2af252abd6334d5b8e2ba8a111e309b041274f1c5ec9e54d02","observation_id":"40b743f7-bc70-444f-8b57-053c8fc6fc83","resolution":{"observed_at":"2026-08-06T20:25:27.267209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14555","last_updated":"2024-06-20T17:58:52Z","snapshot_observed_at":"2026-08-08T18:59:34.400882Z","submitted_at":"2024-06-20T17:58:52Z","title":"A Survey of Multimodal-Guided Image Editing with Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14555","snapshot_observed_at":"2026-08-06T19:34:25.575695Z","title":"A survey of multimodal-guided image editing with text-to-image diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05426","last_updated":"2025-07-07T19:15:43Z","snapshot_observed_at":"2026-08-07T05:29:05.779275Z","submitted_at":"2025-07-07T19:15:43Z","title":"Mastering Regional 3DGS: Locating, Initializing, and Editing with Diverse 2D Priors","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T19:34:25.575695Z"},"links":{"cited_paper":"/paper/2406.14555","citing_paper":"/paper/2507.05426"},"observation_digest":"sha256:e1951502db4ebd53a3a06c880f0b46e23761f15436dd1a2d4c62f8a9f98e6c81","observation_id":"ba30208d-2536-458a-92f1-067bd37636db","resolution":{"observed_at":"2026-08-06T19:34:25.575695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14555","last_updated":"2024-06-20T17:58:52Z","snapshot_observed_at":"2026-08-08T18:59:34.400882Z","submitted_at":"2024-06-20T17:58:52Z","title":"A Survey of Multimodal-Guided Image Editing with Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14555","snapshot_observed_at":"2026-08-06T17:10:56.151197Z","title":"A survey of multimodal-guided image editing with text-to-image diffu- sion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11533","last_updated":"2025-07-15T17:58:08Z","snapshot_observed_at":"2026-08-06T17:04:19.137456Z","submitted_at":"2025-07-15T17:58:08Z","title":"CharaConsist: Fine-Grained Consistent Character Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T17:10:56.151197Z"},"links":{"cited_paper":"/paper/2406.14555","citing_paper":"/paper/2507.11533"},"observation_digest":"sha256:933cb0c11a387e19311abe996dcd7617217edca99975c7371f1fe489c6d1cb69","observation_id":"8165f4f7-8e44-44bb-922b-a229563d7772","resolution":{"observed_at":"2026-08-06T17:10:56.151197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14555","last_updated":"2024-06-20T17:58:52Z","snapshot_observed_at":"2026-08-08T18:59:34.400882Z","submitted_at":"2024-06-20T17:58:52Z","title":"A Survey of Multimodal-Guided Image Editing with Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":"2406.14555","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.14555","snapshot_observed_at":"2026-07-03T14:48:32.608389Z","title":"A survey of multimodal-guided image editing with text-to-image diffusion models","venue":null,"work_id":"a7574e01-1b4b-4ac4-9334-79a174e2c07d","year":2024},"citing_paper":{"arxiv_id":"2604.26031","last_updated":"2026-04-28T18:14:18Z","snapshot_observed_at":"2026-07-06T23:11:48.524898Z","submitted_at":"2026-04-28T18:14:18Z","title":"Report of the 5th PVUW Challenge: Towards More Diverse Modalities in Pixel-Level Understanding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-07T16:52:26.262129Z"},"links":{"cited_paper":"/paper/2406.14555","citing_paper":"/paper/2604.26031"},"observation_digest":"sha256:591b051e379452342d32ea6f22891a655c6f4976e05811aedf7273d6ff900727","observation_id":"e6af47d5-4af3-440e-8548-3eb7ebda4aa4","resolution":{"observed_at":"2026-05-11T23:31:15.614068Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14555","last_updated":"2024-06-20T17:58:52Z","snapshot_observed_at":"2026-08-08T18:59:34.400882Z","submitted_at":"2024-06-20T17:58:52Z","title":"A Survey of Multimodal-Guided Image Editing with Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":"2406.14555","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.14555","snapshot_observed_at":"2026-07-03T14:48:32.608389Z","title":"A survey of multimodal-guided image editing with text-to-image diffusion models","venue":null,"work_id":"a7574e01-1b4b-4ac4-9334-79a174e2c07d","year":2024},"citing_paper":{"arxiv_id":"2605.10204","last_updated":"2026-05-11T08:51:28Z","snapshot_observed_at":"2026-07-06T23:22:13.774652Z","submitted_at":"2026-05-11T08:51:28Z","title":"3DReflecNet: A Large-Scale Dataset for 3D Reconstruction of Reflective, Transparent, and Low-Texture Objects","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-12T04:10:35.320940Z"},"links":{"cited_paper":"/paper/2406.14555","citing_paper":"/paper/2605.10204"},"observation_digest":"sha256:6351fb7828e78cbb414f567bffa7cd7aa10e17277ba0f0398f1b46f27fc41931","observation_id":"59122a93-fd2f-47a9-9bbf-ac778dbaa19e","resolution":{"observed_at":"2026-05-12T06:31:29.034804Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14555","last_updated":"2024-06-20T17:58:52Z","snapshot_observed_at":"2026-08-08T18:59:34.400882Z","submitted_at":"2024-06-20T17:58:52Z","title":"A Survey of Multimodal-Guided Image Editing with Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":"2406.14555","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.14555","snapshot_observed_at":"2026-07-03T14:48:32.608389Z","title":"A survey of multimodal-guided image editing with text-to-image diffusion models","venue":null,"work_id":"a7574e01-1b4b-4ac4-9334-79a174e2c07d","year":2024},"citing_paper":{"arxiv_id":"2605.19750","last_updated":"2026-05-19T12:18:15Z","snapshot_observed_at":"2026-07-06T23:30:25.609722Z","submitted_at":"2026-05-19T12:18:15Z","title":"CPC-VAR:Continual Personalized and Compositional Generation in Visual Autoregressive Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-20T07:01:01.427273Z"},"links":{"cited_paper":"/paper/2406.14555","citing_paper":"/paper/2605.19750"},"observation_digest":"sha256:f4128e04f9b40c5769ffab21ff026e5c3c5ba6e3bcb5abf5519f2e44bfc2655f","observation_id":"892abf8a-cee7-46cd-9aea-c74da73112c2","resolution":{"observed_at":"2026-05-20T07:03:06.239593Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14555","last_updated":"2024-06-20T17:58:52Z","snapshot_observed_at":"2026-08-08T18:59:34.400882Z","submitted_at":"2024-06-20T17:58:52Z","title":"A Survey of Multimodal-Guided Image Editing with Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":"2406.14555","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.14555","snapshot_observed_at":"2026-07-03T14:48:32.608389Z","title":"A survey of multimodal-guided image editing with text-to-image diffusion models","venue":null,"work_id":"a7574e01-1b4b-4ac4-9334-79a174e2c07d","year":2024},"citing_paper":{"arxiv_id":"2605.25568","last_updated":"2026-05-25T08:20:23Z","snapshot_observed_at":"2026-08-07T13:41:58.020131Z","submitted_at":"2026-05-25T08:20:23Z","title":"Rethinking Scribble-Guided Image Editing: Generalization, Instruction Adherence, and Multi-Tasking","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-29T23:06:29.200541Z"},"links":{"cited_paper":"/paper/2406.14555","citing_paper":"/paper/2605.25568"},"observation_digest":"sha256:d5354bb439825c584205d659ee6b50e26bc4c15768a69d5ed0bd89c12f513f97","observation_id":"4396eee7-f712-44f0-95e4-134bbbd06b38","resolution":{"observed_at":"2026-06-29T23:14:02.005615Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14555","last_updated":"2024-06-20T17:58:52Z","snapshot_observed_at":"2026-08-08T18:59:34.400882Z","submitted_at":"2024-06-20T17:58:52Z","title":"A Survey of Multimodal-Guided Image Editing with Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":"2406.14555","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.14555","snapshot_observed_at":"2026-07-03T14:48:32.608389Z","title":"A survey of multimodal-guided image editing with text-to-image diffusion models","venue":null,"work_id":"a7574e01-1b4b-4ac4-9334-79a174e2c07d","year":2024},"citing_paper":{"arxiv_id":"2607.02497","last_updated":"2026-07-02T17:56:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-07-02T17:56:49Z","title":"Seek to Segment: Active Perception for Panoramic Referring Segmentation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-03T14:39:22.617747Z"},"links":{"cited_paper":"/paper/2406.14555","citing_paper":"/paper/2607.02497"},"observation_digest":"sha256:8aab2b3efa79976c32fb7e896c0258f7d4594758c8c9e2a4072e31c3df82221f","observation_id":"0b2d1af0-f569-4eb2-8d1a-0abb21da0e73","resolution":{"observed_at":"2026-07-03T14:48:32.609856Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14555","last_updated":"2024-06-20T17:58:52Z","snapshot_observed_at":"2026-08-08T18:59:34.400882Z","submitted_at":"2024-06-20T17:58:52Z","title":"A Survey of Multimodal-Guided Image Editing with Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14555","snapshot_observed_at":"2026-08-01T12:45:18.568969Z","title":"arXiv preprint arXiv:2406.14555 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19344","last_updated":"2026-07-21T17:59:12Z","snapshot_observed_at":"2026-08-07T03:53:37.076179Z","submitted_at":"2026-07-21T17:59:12Z","title":"Appearance Pointers -- Multimodal Region Control of Diffusion Transformers","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T12:45:18.568969Z"},"links":{"cited_paper":"/paper/2406.14555","citing_paper":"/paper/2607.19344"},"observation_digest":"sha256:fe4f380572c8c3674167aba16f8128b1a697a15b1de32c250a0da9b1c43da710","observation_id":"434f46b2-f6e4-45c2-bbba-52c4b15aa7ec","resolution":{"observed_at":"2026-08-01T12:45:18.568969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2406.14555/citation-record","integrity":"/paper/2406.14555/integrity","json":"/paper/2406.14555/citation-record.json","paper":"/paper/2406.14555"},"outbound":[],"paper":{"arxiv_id":"2406.14555","last_updated":"2024-06-20T17:58:52Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T18:59:34.400882Z","submitted_at":"2024-06-20T17:58:52Z","title":"A Survey of Multimodal-Guided Image Editing with Text-to-Image Diffusion Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 12 inbound Pith citation observations for arXiv:2406.14555."}