{"as_of":"2026-08-13T12:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5f35feacc28e51235e9a9992eceb858500837aa87ae1d9cce0ed2b2fa6d9d43b","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-22T09:25:19.066598Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.21611/citation-record","integrity":"/paper/2605.21611/integrity","json":"/paper/2605.21611/citation-record.json","paper":"/paper/2605.21611"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"cited_work":{"arxiv_id":"2506.09344","doi":"10.48550/arxiv.2506.09344","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09344","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ming-omni: A unified multimodal model for perception and generation","venue":"ArXiv.org","work_id":"eba4dae2-6087-4ecf-ba38-9ab784c1b9a7","year":2025},"citing_paper":{"arxiv_id":"2605.21611","last_updated":"2026-05-20T18:17:50Z","snapshot_observed_at":"2026-08-12T22:57:21.437141Z","submitted_at":"2026-05-20T18:17:50Z","title":"UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:19.066598Z"},"links":{"cited_paper":"/paper/2506.09344","citing_paper":"/paper/2605.21611"},"observation_digest":"sha256:5a7f07c0e6502fd9fc2bfea603991422eccbe5f3435092e31c9c5afea0687cec","observation_id":"f9ee4736-29c4-4eb7-a044-59007715992e","resolution":{"observed_at":"2026-05-22T09:26:20.784211Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13418","last_updated":"2023-08-25T15:03:36Z","snapshot_observed_at":"2026-08-12T03:48:04.422679Z","submitted_at":"2023-08-25T15:03:36Z","title":"Nougat: Neural Optical Understanding for Academic Documents","version":1},"cited_work":{"arxiv_id":"2308.13418","doi":"10.48550/arxiv.2308.13418","metadata_source":"pith","pith_arxiv_id":"2308.13418","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Nougat: Neural Optical Understanding for Academic Documents","venue":"cs.LG","work_id":"26c3b627-7e97-40d7-bab3-020936b8196b","year":2023},"citing_paper":{"arxiv_id":"2605.21611","last_updated":"2026-05-20T18:17:50Z","snapshot_observed_at":"2026-08-12T22:57:21.437141Z","submitted_at":"2026-05-20T18:17:50Z","title":"UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:19.066598Z"},"links":{"cited_paper":"/paper/2308.13418","citing_paper":"/paper/2605.21611"},"observation_digest":"sha256:3725eba0e3efd56b82c995cf90494b9dabc7b469cff4983fc8a047368fdcea97","observation_id":"b5095ec4-53ae-4cf5-945c-c4decadf84b6","resolution":{"observed_at":"2026-05-22T09:26:20.807752Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09800","last_updated":"2023-01-18T17:31:52Z","snapshot_observed_at":"2026-08-06T07:25:23.651829Z","submitted_at":"2022-11-17T18:58:43Z","title":"InstructPix2Pix: Learning to Follow Image Editing Instructions","version":2},"cited_work":{"arxiv_id":"2211.09800","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2211.09800","snapshot_observed_at":"2026-07-04T10:19:47.353241Z","title":"InstructPix2Pix: Learning to Follow Image Editing Instructions","venue":null,"work_id":"de9c4a95-36ff-4e97-a0c0-3cca39f60b1a","year":2022},"citing_paper":{"arxiv_id":"2605.21611","last_updated":"2026-05-20T18:17:50Z","snapshot_observed_at":"2026-08-12T22:57:21.437141Z","submitted_at":"2026-05-20T18:17:50Z","title":"UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:19.066598Z"},"links":{"cited_paper":"/paper/2211.09800","citing_paper":"/paper/2605.21611"},"observation_digest":"sha256:331dee14a56fee1cf3299483dd3f38078f92b899778b42d6b9cf79a135430d56","observation_id":"8ce526d6-a5da-497b-a961-57b2ea8a45b8","resolution":{"observed_at":"2026-05-22T09:26:20.779221Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Textdiffuser: Diffusion models as text painters","venue":null,"work_id":"0b317ed3-fa9a-4888-b814-45353eb336d7","year":2023},"citing_paper":{"arxiv_id":"2605.21611","last_updated":"2026-05-20T18:17:50Z","snapshot_observed_at":"2026-08-12T22:57:21.437141Z","submitted_at":"2026-05-20T18:17:50Z","title":"UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:19.066598Z"},"links":{"citing_paper":"/paper/2605.21611"},"observation_digest":"sha256:68838ca601e76cbe9c0802dd6d6792b632e4396e2c8763f7fb9477b60fbd2350","observation_id":"28a45d0d-6e1c-47ce-88c4-d9bff06cbdb3","resolution":{"observed_at":"2026-05-22T09:26:21.105030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Anydoor: Zero- shot object-level image customization","venue":null,"work_id":"da8cddf3-54ee-4b73-afa3-301eea3527d2","year":2024},"citing_paper":{"arxiv_id":"2605.21611","last_updated":"2026-05-20T18:17:50Z","snapshot_observed_at":"2026-08-12T22:57:21.437141Z","submitted_at":"2026-05-20T18:17:50Z","title":"UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:19.066598Z"},"links":{"citing_paper":"/paper/2605.21611"},"observation_digest":"sha256:9d1a8a3bcc28f384e53ca44828666e37f9dc92d44d046cfa69b98df353b7263d","observation_id":"b7b9a8ed-a566-4ab9-9b41-df3fb1a561a9","resolution":{"observed_at":"2026-05-22T09:26:21.101857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-08-12T12:44:22.350068Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"cited_work":{"arxiv_id":"2501.17811","doi":"10.48550/arxiv.2501.17811","metadata_source":"pith","pith_arxiv_id":"2501.17811","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","venue":"cs.AI","work_id":"67d9e391-26d1-459e-ab56-07e60511c886","year":2025},"citing_paper":{"arxiv_id":"2605.21611","last_updated":"2026-05-20T18:17:50Z","snapshot_observed_at":"2026-08-12T22:57:21.437141Z","submitted_at":"2026-05-20T18:17:50Z","title":"UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:19.066598Z"},"links":{"cited_paper":"/paper/2501.17811","citing_paper":"/paper/2605.21611"},"observation_digest":"sha256:144699ec5d5fe4520f6da231b3b187142b36ef63e6ce7c5a0a57364c3a4d9225","observation_id":"5d7c2be3-5219-4df0-a6e0-dd70cddb09a1","resolution":{"observed_at":"2026-05-22T09:26:20.789280Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.05233","last_updated":"2021-06-01T17:49:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-05-11T17:50:24Z","title":"Diffusion Models Beat GANs on Image Synthesis","version":4},"cited_work":{"arxiv_id":"2105.05233","doi":"10.48550/arxiv.2105.05233","metadata_source":"pith","pith_arxiv_id":"2105.05233","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Diffusion Models Beat GANs on Image Synthesis","venue":"cs.LG","work_id":"2eb944bb-93ba-462c-8111-4e8c915dd873","year":2021},"citing_paper":{"arxiv_id":"2605.21611","last_updated":"2026-05-20T18:17:50Z","snapshot_observed_at":"2026-08-12T22:57:21.437141Z","submitted_at":"2026-05-20T18:17:50Z","title":"UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:19.066598Z"},"links":{"cited_paper":"/paper/2105.05233","citing_paper":"/paper/2605.21611"},"observation_digest":"sha256:694b6638b56753eca7540756ca44351d26fcc2e0e3895881a1e2663e37130b20","observation_id":"8524f1f3-0e75-474c-b4f6-398f929e8a88","resolution":{"observed_at":"2026-05-22T09:26:20.793708Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-05-24T01:23:30.424112+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T01:23:30.424112+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.09595","last_updated":"2025-07-13T11:51:53Z","snapshot_observed_at":"2026-08-12T05:02:56.051984Z","submitted_at":"2025-07-13T11:51:53Z","title":"Demystifying Flux Architecture","version":1},"cited_work":{"arxiv_id":"2507.09595","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.09595","snapshot_observed_at":"2026-07-02T11:36:55.456502Z","title":"Demystifying flux architecture","venue":null,"work_id":"6b0e2244-d426-43bb-9a34-323f3d8b0ab8","year":2025},"citing_paper":{"arxiv_id":"2605.21611","last_updated":"2026-05-20T18:17:50Z","snapshot_observed_at":"2026-08-12T22:57:21.437141Z","submitted_at":"2026-05-20T18:17:50Z","title":"UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:19.066598Z"},"links":{"cited_paper":"/paper/2507.09595","citing_paper":"/paper/2605.21611"},"observation_digest":"sha256:0cf768e67767ec8e222b01faf36ab0761c63436462384b40816898c698895a82","observation_id":"83f599ec-a41a-4cfb-ac98-f26ecb5157bf","resolution":{"observed_at":"2026-05-22T09:26:20.803649Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01626","last_updated":"2022-08-02T17:55:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-02T17:55:41Z","title":"Prompt-to-Prompt Image Editing with Cross Attention Control","version":1},"cited_work":{"arxiv_id":"2208.01626","doi":"10.48500/arxiv.2208.01626","metadata_source":"pith","pith_arxiv_id":"2208.01626","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Prompt-to-Prompt Image Editing with Cross Attention Control","venue":"cs.CV","work_id":"196f7eef-d65a-47e4-b815-9a188f6aedcf","year":2022},"citing_paper":{"arxiv_id":"2605.21611","last_updated":"2026-05-20T18:17:50Z","snapshot_observed_at":"2026-08-12T22:57:21.437141Z","submitted_at":"2026-05-20T18:17:50Z","title":"UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:19.066598Z"},"links":{"cited_paper":"/paper/2208.01626","citing_paper":"/paper/2605.21611"},"observation_digest":"sha256:78eb37baead8115f7a6b633a99557a04edc7a243fff8ee8e69207ef50401a0f3","observation_id":"9488ac53-35bc-469f-a3b8-3201efc5f28c","resolution":{"observed_at":"2026-05-22T09:26:20.798428Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.11239","last_updated":"2020-12-16T21:15:05Z","snapshot_observed_at":"2026-08-10T05:21:27.485481Z","submitted_at":"2020-06-19T17:24:44Z","title":"Denoising Diffusion Probabilistic Models","version":2},"cited_work":{"arxiv_id":"2006.11239","doi":"10.48550/arxiv.2006.11239","metadata_source":"pith","pith_arxiv_id":"2006.11239","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Denoising Diffusion Probabilistic Models","venue":"cs.LG","work_id":"dc023f4e-7c79-471c-b713-deeb559ba010","year":2020},"citing_paper":{"arxiv_id":"2605.21611","last_updated":"2026-05-20T18:17:50Z","snapshot_observed_at":"2026-08-12T22:57:21.437141Z","submitted_at":"2026-05-20T18:17:50Z","title":"UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:19.066598Z"},"links":{"cited_paper":"/paper/2006.11239","citing_paper":"/paper/2605.21611"},"observation_digest":"sha256:7d53f5c055ce428ae80a3bee2ac27851c30279e653bb717fd890b05a1d022a98","observation_id":"e4866763-e7c6-4584-aac1-374522c0023a","resolution":{"observed_at":"2026-05-22T09:26:20.773573Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:06.511104+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:06.511104+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Brushnet: A plug-and-play image inpainting model with decomposed dual-branch diffusion","venue":null,"work_id":"26ed48dc-c108-432b-9803-0a1ede05367a","year":2024},"citing_paper":{"arxiv_id":"2605.21611","last_updated":"2026-05-20T18:17:50Z","snapshot_observed_at":"2026-08-12T22:57:21.437141Z","submitted_at":"2026-05-20T18:17:50Z","title":"UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:19.066598Z"},"links":{"citing_paper":"/paper/2605.21611"},"observation_digest":"sha256:42f595ca0c29425c45482ac2b30c5dabf8ccbe4629749fa84f674158734a4a35","observation_id":"d7e8133b-e81c-4b8d-b985-1469f3022c78","resolution":{"observed_at":"2026-05-22T09:26:21.108241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A style-based generator architecture for generative adversar- ial networks","venue":null,"work_id":"e760873e-5bcc-47a6-ac6b-c6a957995d0e","year":2019},"citing_paper":{"arxiv_id":"2605.21611","last_updated":"2026-05-20T18:17:50Z","snapshot_observed_at":"2026-08-12T22:57:21.437141Z","submitted_at":"2026-05-20T18:17:50Z","title":"UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:19.066598Z"},"links":{"citing_paper":"/paper/2605.21611"},"observation_digest":"sha256:a1865a6491167589172ae0e123d9c3031a5b2aa801f30bfa168e5c733470ea3c","observation_id":"bd08cfa4-afd8-4379-8129-51fe1fea28b8","resolution":{"observed_at":"2026-05-22T09:26:21.078006Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T09:14:47.729548Z","title":"Musiq: Multi-scale image quality transformer","venue":null,"work_id":"d4028a91-9152-4f10-95b7-edb74a2f0e38","year":2021},"citing_paper":{"arxiv_id":"2605.21611","last_updated":"2026-05-20T18:17:50Z","snapshot_observed_at":"2026-08-12T22:57:21.437141Z","submitted_at":"2026-05-20T18:17:50Z","title":"UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:19.066598Z"},"links":{"citing_paper":"/paper/2605.21611"},"observation_digest":"sha256:01696a1b7722498dea3f8b4a6c0e40dfc8882e50348e6be5269cc29e9f877568","observation_id":"2e377043-cd8f-49d2-9bab-2a21f7d1a85a","resolution":{"observed_at":"2026-05-22T09:26:21.091733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-08-12T12:01:54.105712Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":"2301.12597","doi":"10.48550/arxiv.2301.12597","metadata_source":"pith","pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","venue":"cs.CV","work_id":"63d03f4d-15f4-4583-8286-913c19f02294","year":2023},"citing_paper":{"arxiv_id":"2605.21611","last_updated":"2026-05-20T18:17:50Z","snapshot_observed_at":"2026-08-12T22:57:21.437141Z","submitted_at":"2026-05-20T18:17:50Z","title":"UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:19.066598Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2605.21611"},"observation_digest":"sha256:faf86291a0d5a9f320b4a76756201abf5f48f491784c8e21d3b014a4af2d710d","observation_id":"9b53c889-ee76-4457-9a18-170b68a99b45","resolution":{"observed_at":"2026-05-22T09:26:20.727279Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:49:47.354893+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:49:47.354893+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gligen: Open-set grounded text-to-image generation","venue":null,"work_id":"3acd25f7-b49f-4a3d-b180-40484642c026","year":2023},"citing_paper":{"arxiv_id":"2605.21611","last_updated":"2026-05-20T18:17:50Z","snapshot_observed_at":"2026-08-12T22:57:21.437141Z","submitted_at":"2026-05-20T18:17:50Z","title":"UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:19.066598Z"},"links":{"citing_paper":"/paper/2605.21611"},"observation_digest":"sha256:8f322650284ea0921a062327cff226de61fd7955d83e7214330c260eddefa7af","observation_id":"653956ce-3acc-4992-8711-f570c1e5b97a","resolution":{"observed_at":"2026-05-22T09:26:21.074980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":"2303.05499","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-07-10T23:17:45.410080Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","venue":"cs.CV","work_id":"3757dc8f-79d5-4beb-a03b-eb4c9a33427d","year":2023},"citing_paper":{"arxiv_id":"2605.21611","last_updated":"2026-05-20T18:17:50Z","snapshot_observed_at":"2026-08-12T22:57:21.437141Z","submitted_at":"2026-05-20T18:17:50Z","title":"UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:19.066598Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2605.21611"},"observation_digest":"sha256:0b7e018fc642cc85960c11ccb76417a717e5643d183531d00d74f1c512ec2b27","observation_id":"99ca2bf9-9662-4d98-8565-4c15972f8df9","resolution":{"observed_at":"2026-05-22T09:26:20.722625Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Repaint: Inpainting using denoising diffusion probabilistic models","venue":null,"work_id":"e4449495-d6fb-47a0-97ed-c1f67aef948b","year":2022},"citing_paper":{"arxiv_id":"2605.21611","last_updated":"2026-05-20T18:17:50Z","snapshot_observed_at":"2026-08-12T22:57:21.437141Z","submitted_at":"2026-05-20T18:17:50Z","title":"UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:19.066598Z"},"links":{"citing_paper":"/paper/2605.21611"},"observation_digest":"sha256:6b19743f74b9194af7ded8a472eb83ee3dc61484456f3fbefb3d3304579b9847","observation_id":"37d2f4f1-d39b-437b-a7c6-82ea543d0408","resolution":{"observed_at":"2026-05-22T09:26:21.081507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17870","last_updated":"2023-05-23T04:07:00Z","snapshot_observed_at":"2026-08-13T12:12:43.873574Z","submitted_at":"2023-03-31T08:06:33Z","title":"GlyphDraw: Seamlessly Rendering Text with Intricate Spatial Structures in Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2303.17870","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2303.17870","snapshot_observed_at":"2026-07-04T19:30:07.398512Z","title":"Glyphdraw: Seamlessly rendering text with intricate spatial structures in text-to-image generation","venue":null,"work_id":"25a92acb-7f31-40c0-85d4-cb2c16bfce7e","year":2023},"citing_paper":{"arxiv_id":"2605.21611","last_updated":"2026-05-20T18:17:50Z","snapshot_observed_at":"2026-08-12T22:57:21.437141Z","submitted_at":"2026-05-20T18:17:50Z","title":"UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:19.066598Z"},"links":{"cited_paper":"/paper/2303.17870","citing_paper":"/paper/2605.21611"},"observation_digest":"sha256:536c46036cd22f6b5640203c626b633b7ec06af9ff468c09ac5c295fe722fb43","observation_id":"c62f74dd-006a-4a95-800c-4c0ba9772ca1","resolution":{"observed_at":"2026-05-22T09:26:20.712176Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:27:53.052702Z","title":"Semantic image synthesis with spatially-adaptive normalization","venue":null,"work_id":"e7e67a5d-a26e-4214-bb44-12aac0bf71b1","year":2019},"citing_paper":{"arxiv_id":"2605.21611","last_updated":"2026-05-20T18:17:50Z","snapshot_observed_at":"2026-08-12T22:57:21.437141Z","submitted_at":"2026-05-20T18:17:50Z","title":"UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:19.066598Z"},"links":{"citing_paper":"/paper/2605.21611"},"observation_digest":"sha256:f72113dc6871d2ad1c2f51c0a2f67d52b1773f63d3e0163bd748ae3406abfd01","observation_id":"9aa96945-010b-4485-a1d9-8efec66cfa4e","resolution":{"observed_at":"2026-05-22T09:26:21.064550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:27:53.186413Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":"0c67bec8-6388-449f-9600-64c8ea9bc79f","year":2023},"citing_paper":{"arxiv_id":"2605.21611","last_updated":"2026-05-20T18:17:50Z","snapshot_observed_at":"2026-08-12T22:57:21.437141Z","submitted_at":"2026-05-20T18:17:50Z","title":"UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:19.066598Z"},"links":{"citing_paper":"/paper/2605.21611"},"observation_digest":"sha256:a5d6c9ae88806b0a6f7488683fdbb11400ed21497e65f35e93509c651da24895","observation_id":"2f98f065-2389-4ab9-9e81-2186815c78df","resolution":{"observed_at":"2026-05-22T09:26:21.067867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":"2103.00020","doi":"10.1021/acs.jcim.0c00174","metadata_source":"pith","pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Learning Transferable Visual Models From Natural Language Supervision","venue":"cs.CV","work_id":"6de86bb5-27bd-4d5c-8b89-967ebfc52659","year":2021},"citing_paper":{"arxiv_id":"2605.21611","last_updated":"2026-05-20T18:17:50Z","snapshot_observed_at":"2026-08-12T22:57:21.437141Z","submitted_at":"2026-05-20T18:17:50Z","title":"UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:19.066598Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2605.21611"},"observation_digest":"sha256:8dafe0fe5e7de3210036e19a267c41e790ce0526e155d4c27b53c83a78e2d2a7","observation_id":"1c763e88-d7a7-4421-975b-499e995bb117","resolution":{"observed_at":"2026-05-22T09:26:20.751151Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":"2204.06125","doi":"10.48550/arxiv.2204.06125","metadata_source":"pith","pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","venue":"cs.CV","work_id":"0c6a768b-70b8-4242-bb0e-459f1008c9fc","year":2022},"citing_paper":{"arxiv_id":"2605.21611","last_updated":"2026-05-20T18:17:50Z","snapshot_observed_at":"2026-08-12T22:57:21.437141Z","submitted_at":"2026-05-20T18:17:50Z","title":"UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:19.066598Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2605.21611"},"observation_digest":"sha256:b858e75dd7c4174250d1c8a0673729024b621990dfeb2033d5cf088445ad21b1","observation_id":"d520d741-dfc8-46af-be69-95eb11f1ca9c","resolution":{"observed_at":"2026-05-22T09:26:20.759730Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:50:02.412412+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:50:02.412412+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.17189","last_updated":"2022-03-31T17:12:13Z","snapshot_observed_at":"2026-08-10T18:28:25.800458Z","submitted_at":"2022-03-31T17:12:13Z","title":"Scaling Up Models and Data with $\\texttt{t5x}$ and $\\texttt{seqio}$","version":1},"cited_work":{"arxiv_id":"2203.17189","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.17189","snapshot_observed_at":"2026-06-30T15:44:48.510903Z","title":"Alexey Romanov and Chaitanya Shivade","venue":null,"work_id":"b4ce3d71-9be2-4401-8618-528a87b188bd","year":2022},"citing_paper":{"arxiv_id":"2605.21611","last_updated":"2026-05-20T18:17:50Z","snapshot_observed_at":"2026-08-12T22:57:21.437141Z","submitted_at":"2026-05-20T18:17:50Z","title":"UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:19.066598Z"},"links":{"cited_paper":"/paper/2203.17189","citing_paper":"/paper/2605.21611"},"observation_digest":"sha256:d4e145863b2206ece17b3f8f57937bb05cab9c772661e89e94f32d2a95e8dedd","observation_id":"42a2e913-e131-413e-a98e-a300fd8a95da","resolution":{"observed_at":"2026-05-22T09:26:20.769472Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10752","last_updated":"2022-04-13T11:38:44Z","snapshot_observed_at":"2026-07-06T12:20:47.369918Z","submitted_at":"2021-12-20T18:55:25Z","title":"High-Resolution Image Synthesis with Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":"2112.10752","doi":"10.48550/arxiv.2112.10752","metadata_source":"pith","pith_arxiv_id":"2112.10752","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"High-Resolution Image Synthesis with Latent Diffusion Models","venue":"cs.CV","work_id":"f0270d36-2952-47fb-84c1-95e3ec341126","year":2021},"citing_paper":{"arxiv_id":"2605.21611","last_updated":"2026-05-20T18:17:50Z","snapshot_observed_at":"2026-08-12T22:57:21.437141Z","submitted_at":"2026-05-20T18:17:50Z","title":"UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:19.066598Z"},"links":{"cited_paper":"/paper/2112.10752","citing_paper":"/paper/2605.21611"},"observation_digest":"sha256:2dd6c65c22711b4d3e3e3621ed3616782b3324d9abee49e9a5b78f759d996931","observation_id":"354ddd2e-350f-488f-88f1-7f3289730960","resolution":{"observed_at":"2026-05-22T09:26:20.755259Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-05-24T01:24:00.877132+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T01:24:00.877132+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models.Advances in neural information processing systems, 35:25278–25294","venue":null,"work_id":"25581cba-8e27-40a4-86eb-c560ee7d7bbd","year":2022},"citing_paper":{"arxiv_id":"2605.21611","last_updated":"2026-05-20T18:17:50Z","snapshot_observed_at":"2026-08-12T22:57:21.437141Z","submitted_at":"2026-05-20T18:17:50Z","title":"UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:19.066598Z"},"links":{"citing_paper":"/paper/2605.21611"},"observation_digest":"sha256:7cd6b150d8256088eda17dab990e52cb13cee9640c1082ed68d910972c6eb00e","observation_id":"9c25e2c3-6a69-4367-af4b-7e84cb1db5a1","resolution":{"observed_at":"2026-05-22T09:26:21.071652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ominicontrol: Min- imal and universal control for diffusion transformer","venue":null,"work_id":"1e9c246f-726e-4929-827b-18784c439a27","year":2025},"citing_paper":{"arxiv_id":"2605.21611","last_updated":"2026-05-20T18:17:50Z","snapshot_observed_at":"2026-08-12T22:57:21.437141Z","submitted_at":"2026-05-20T18:17:50Z","title":"UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:19.066598Z"},"links":{"citing_paper":"/paper/2605.21611"},"observation_digest":"sha256:7986777df9ba193dc288303030fc2c6ad0db734e5e7855db8ad3fc4bf2ed3e54","observation_id":"dc7f86de-d30c-4621-9a55-0870c79384f0","resolution":{"observed_at":"2026-05-22T09:26:21.088603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.06119","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T10:29:44.547305Z","title":"Omni-video: Democra- tizing unified video understanding and generation","venue":null,"work_id":"ff3fdc36-7023-4bae-ae8b-c28ff8524967","year":2025},"citing_paper":{"arxiv_id":"2605.21611","last_updated":"2026-05-20T18:17:50Z","snapshot_observed_at":"2026-08-12T22:57:21.437141Z","submitted_at":"2026-05-20T18:17:50Z","title":"UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:19.066598Z"},"links":{"citing_paper":"/paper/2605.21611"},"observation_digest":"sha256:1dc6851201241c4ba33d06ab3a47c35915937a15436bed8b26adc269acba21e1","observation_id":"d3e474c7-4cb7-4026-9265-8ff4885844b6","resolution":{"observed_at":"2026-05-22T09:26:20.764404Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03054","last_updated":"2024-02-21T07:12:45Z","snapshot_observed_at":"2026-08-13T05:32:13.331302Z","submitted_at":"2023-11-06T12:10:43Z","title":"AnyText: Multilingual Visual Text Generation And Editing","version":5},"cited_work":{"arxiv_id":"2311.03054","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.03054","snapshot_observed_at":"2026-07-04T10:29:44.518677Z","title":"Anytext: Multilingual visual text generation and editing","venue":null,"work_id":"6ca52f26-db50-422e-86c6-89c334703122","year":2023},"citing_paper":{"arxiv_id":"2605.21611","last_updated":"2026-05-20T18:17:50Z","snapshot_observed_at":"2026-08-12T22:57:21.437141Z","submitted_at":"2026-05-20T18:17:50Z","title":"UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:19.066598Z"},"links":{"cited_paper":"/paper/2311.03054","citing_paper":"/paper/2605.21611"},"observation_digest":"sha256:37144b6447a2aed9e8fa82dac732c67abbfe4219811bb833305aebdbeea1f464","observation_id":"c5fc9805-f99b-445c-814b-aba84d2adc10","resolution":{"observed_at":"2026-05-22T09:26:20.717505Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01704","last_updated":"2024-09-03T08:41:31Z","snapshot_observed_at":"2026-08-10T02:15:09.754142Z","submitted_at":"2024-09-03T08:41:31Z","title":"General OCR Theory: Towards OCR-2.0 via a Unified End-to-end Model","version":1},"cited_work":{"arxiv_id":"2409.01704","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.01704","snapshot_observed_at":"2026-07-08T20:35:34.407064Z","title":"General OCR Theory: Towards OCR-2.0 via a Unified End-to-end Model","venue":"cs.CV","work_id":"67b1592f-02b6-4056-b3fe-cc594e484192","year":2024},"citing_paper":{"arxiv_id":"2605.21611","last_updated":"2026-05-20T18:17:50Z","snapshot_observed_at":"2026-08-12T22:57:21.437141Z","submitted_at":"2026-05-20T18:17:50Z","title":"UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:19.066598Z"},"links":{"cited_paper":"/paper/2409.01704","citing_paper":"/paper/2605.21611"},"observation_digest":"sha256:1cdc68889682593be3bae6fe5f6d72e9121f8afbc0ca3f3c4e93f61f63817826","observation_id":"53fcbf81-7705-44f2-bdd4-9d5f88fa8717","resolution":{"observed_at":"2026-05-22T09:26:20.695715Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.18234","last_updated":"2025-10-21T02:41:44Z","snapshot_observed_at":"2026-07-06T22:33:39.148066Z","submitted_at":"2025-10-21T02:41:44Z","title":"DeepSeek-OCR: Contexts Optical Compression","version":1},"cited_work":{"arxiv_id":"2510.18234","doi":"10.48550/arxiv.2510.18234","metadata_source":"pith","pith_arxiv_id":"2510.18234","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-OCR: Contexts Optical Compression","venue":"cs.CV","work_id":"e85551be-f243-4764-886f-76a8813ccbb8","year":2025},"citing_paper":{"arxiv_id":"2605.21611","last_updated":"2026-05-20T18:17:50Z","snapshot_observed_at":"2026-08-12T22:57:21.437141Z","submitted_at":"2026-05-20T18:17:50Z","title":"UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:19.066598Z"},"links":{"cited_paper":"/paper/2510.18234","citing_paper":"/paper/2605.21611"},"observation_digest":"sha256:b66e27a79655fe93b1b43de8705dc7cd005d35828d6b399e0f9f90d31bbaedc6","observation_id":"d1d634a9-f8ad-49a2-a030-998f632dc134","resolution":{"observed_at":"2026-05-22T09:26:20.706394Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.20552","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T17:07:25.727485Z","title":"Deepseek-ocr 2: Visual causal flow","venue":null,"work_id":"9886dce9-776e-4ad6-b96c-fbf9037ca41c","year":2026},"citing_paper":{"arxiv_id":"2605.21611","last_updated":"2026-05-20T18:17:50Z","snapshot_observed_at":"2026-08-12T22:57:21.437141Z","submitted_at":"2026-05-20T18:17:50Z","title":"UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:19.066598Z"},"links":{"citing_paper":"/paper/2605.21611"},"observation_digest":"sha256:376829d8551f1c694108a59c5eb4ebb91cdd7714cb7241b8a3df7f2f4f8a6639","observation_id":"8c761652-e10c-45df-983f-fb3b13f4f356","resolution":{"observed_at":"2026-05-22T09:26:20.701364Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13848","last_updated":"2024-10-17T17:58:37Z","snapshot_observed_at":"2026-08-03T03:16:45.693966Z","submitted_at":"2024-10-17T17:58:37Z","title":"Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation","version":1},"cited_work":{"arxiv_id":"2410.13848","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.13848","snapshot_observed_at":"2026-07-04T10:19:47.348172Z","title":"Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation","venue":"cs.CV","work_id":"8aa59998-5ac6-4ee1-bcb4-cf7fe479058b","year":2024},"citing_paper":{"arxiv_id":"2605.21611","last_updated":"2026-05-20T18:17:50Z","snapshot_observed_at":"2026-08-12T22:57:21.437141Z","submitted_at":"2026-05-20T18:17:50Z","title":"UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:19.066598Z"},"links":{"cited_paper":"/paper/2410.13848","citing_paper":"/paper/2605.21611"},"observation_digest":"sha256:4a111f6817db9a10c661ac84fdd05da1b825cd00e827a3723f7f978b91957355","observation_id":"b8705968-57a0-4b7e-b311-35719e7ce089","resolution":{"observed_at":"2026-05-22T09:26:20.737616Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Omnigen: Unified image generation","venue":null,"work_id":"44c4767d-e473-4f19-9c97-e1a4804dfa19","year":2025},"citing_paper":{"arxiv_id":"2605.21611","last_updated":"2026-05-20T18:17:50Z","snapshot_observed_at":"2026-08-12T22:57:21.437141Z","submitted_at":"2026-05-20T18:17:50Z","title":"UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:19.066598Z"},"links":{"citing_paper":"/paper/2605.21611"},"observation_digest":"sha256:bff54bce078223c928cf431f85f46169803dee5d15530109511a0fb6e257136c","observation_id":"8f3d3cf9-c942-44af-ad24-af88ed4a70f8","resolution":{"observed_at":"2026-05-22T09:26:21.085223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Paint by example: Exemplar-based image editing with diffusion models","venue":null,"work_id":"bad159e9-ee83-4426-85c0-e40304a8a1d0","year":2023},"citing_paper":{"arxiv_id":"2605.21611","last_updated":"2026-05-20T18:17:50Z","snapshot_observed_at":"2026-08-12T22:57:21.437141Z","submitted_at":"2026-05-20T18:17:50Z","title":"UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:19.066598Z"},"links":{"citing_paper":"/paper/2605.21611"},"observation_digest":"sha256:dd232eefe5c115bf7b65a2ebc7f94dc16b344348683493b6ddef661174a28de2","observation_id":"ab611996-7029-4139-8fd1-d9aa9b7c8fdb","resolution":{"observed_at":"2026-05-22T09:26:21.095108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20275","last_updated":"2025-05-26T17:53:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:53:33Z","title":"ImgEdit: A Unified Image Editing Dataset and Benchmark","version":1},"cited_work":{"arxiv_id":"2505.20275","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.20275","snapshot_observed_at":"2026-07-10T13:27:05.927875Z","title":"ImgEdit: A Unified Image Editing Dataset and Benchmark","venue":"cs.CV","work_id":"059b5c3a-404c-4d30-a631-68c1d88a08a7","year":2025},"citing_paper":{"arxiv_id":"2605.21611","last_updated":"2026-05-20T18:17:50Z","snapshot_observed_at":"2026-08-12T22:57:21.437141Z","submitted_at":"2026-05-20T18:17:50Z","title":"UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:19.066598Z"},"links":{"cited_paper":"/paper/2505.20275","citing_paper":"/paper/2605.21611"},"observation_digest":"sha256:eb823ca3cdeb5c2527a8608c913655eb4b52af83f85e548f6231c640fe210d2c","observation_id":"fbfdd351-9b9c-4eae-a68f-3166f4fc26da","resolution":{"observed_at":"2026-05-22T09:26:20.741995Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.05543","last_updated":"2023-11-26T22:26:12Z","snapshot_observed_at":"2026-08-04T15:27:22.366324Z","submitted_at":"2023-02-10T23:12:37Z","title":"Adding Conditional Control to Text-to-Image Diffusion Models","version":3},"cited_work":{"arxiv_id":"2302.05543","doi":"10.1145/3240323.3241729","metadata_source":"pith","pith_arxiv_id":"2302.05543","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Adding Conditional Control to Text-to-Image Diffusion Models","venue":"cs.CV","work_id":"226c10cc-8cc0-4c01-9358-f23db6c470c7","year":2023},"citing_paper":{"arxiv_id":"2605.21611","last_updated":"2026-05-20T18:17:50Z","snapshot_observed_at":"2026-08-12T22:57:21.437141Z","submitted_at":"2026-05-20T18:17:50Z","title":"UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:19.066598Z"},"links":{"cited_paper":"/paper/2302.05543","citing_paper":"/paper/2605.21611"},"observation_digest":"sha256:dcef6f3db2a2d1cbf1c34e09a3cc3ee928bd056565ad58420ed7ebb175b0f19f","observation_id":"915eae3d-299d-4543-ab68-ea78f422d9ed","resolution":{"observed_at":"2026-05-22T09:26:20.746997Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unpaired image-to-image translation using cycle-consistent adversarial networks","venue":null,"work_id":"cb542f67-bbc4-4121-abdb-152084166659","year":2017},"citing_paper":{"arxiv_id":"2605.21611","last_updated":"2026-05-20T18:17:50Z","snapshot_observed_at":"2026-08-12T22:57:21.437141Z","submitted_at":"2026-05-20T18:17:50Z","title":"UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:19.066598Z"},"links":{"citing_paper":"/paper/2605.21611"},"observation_digest":"sha256:2c31bf86b182d19a2634849d2745d11f920b555a377b845cd83bc190c4dfe10e","observation_id":"0677353e-6415-4072-a3fe-cf3a01ae01dd","resolution":{"observed_at":"2026-05-22T09:26:21.098748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A task is worth one word: Learning with task prompts for high-quality versatile image inpainting","venue":null,"work_id":"f2bab21e-aeb1-4790-8ac8-02827e39ed75","year":2024},"citing_paper":{"arxiv_id":"2605.21611","last_updated":"2026-05-20T18:17:50Z","snapshot_observed_at":"2026-08-12T22:57:21.437141Z","submitted_at":"2026-05-20T18:17:50Z","title":"UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:19.066598Z"},"links":{"citing_paper":"/paper/2605.21611"},"observation_digest":"sha256:2cb071e0bd777ce82fc3ff6fdd59ebbd4530c9d45f46e377091912bad9306b77","observation_id":"307974bf-dfd1-48a8-81d6-67dfa5595704","resolution":{"observed_at":"2026-05-22T09:26:21.061206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"96293e14-b951-473a-8cc6-984917d7ace5","year":null},"citing_paper":{"arxiv_id":"2605.21611","last_updated":"2026-05-20T18:17:50Z","snapshot_observed_at":"2026-08-12T22:57:21.437141Z","submitted_at":"2026-05-20T18:17:50Z","title":"UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:19.066598Z"},"links":{"citing_paper":"/paper/2605.21611"},"observation_digest":"sha256:43e9a442466be8cddaaa749c93c3fbc98379a7321200033fb5476b52b0fe161b","observation_id":"7bbe8cac-2642-4c61-a2d0-8a9a4f521ca5","resolution":{"observed_at":"2026-05-22T09:26:21.054117Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"65835cba-7eba-48b7-9a71-e4e34b194187","year":null},"citing_paper":{"arxiv_id":"2605.21611","last_updated":"2026-05-20T18:17:50Z","snapshot_observed_at":"2026-08-12T22:57:21.437141Z","submitted_at":"2026-05-20T18:17:50Z","title":"UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:19.066598Z"},"links":{"citing_paper":"/paper/2605.21611"},"observation_digest":"sha256:44462e17d787d5203c8d5b3e934d4038f856f796950b2a9e4f91398eb02df7a9","observation_id":"6ccd17de-a318-4717-b189-794b0442c827","resolution":{"observed_at":"2026-05-22T09:26:21.057550Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"4860.2872","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"with CLIP semantic instruction","venue":null,"work_id":"2fec7839-bfd2-4e06-8258-41ff85d3bbe4","year":null},"citing_paper":{"arxiv_id":"2605.21611","last_updated":"2026-05-20T18:17:50Z","snapshot_observed_at":"2026-08-12T22:57:21.437141Z","submitted_at":"2026-05-20T18:17:50Z","title":"UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-22T09:25:19.066598Z"},"links":{"citing_paper":"/paper/2605.21611"},"observation_digest":"sha256:5de581112bb9f798302167883fc8a02bbe151c261cb75e55b1dc94e5c7e1e822","observation_id":"9726b270-0018-4994-b3af-627d55015f88","resolution":{"observed_at":"2026-05-22T09:26:20.732509Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.21611","last_updated":"2026-05-20T18:17:50Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T22:57:21.437141Z","submitted_at":"2026-05-20T18:17:50Z","title":"UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":2,"verified_exact":23,"verified_fuzzy":15},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 0 inbound Pith citation observations for arXiv:2605.21611."}