{"as_of":"2026-08-09T16:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1ba2adca81ba165f09b780c6a4822f6a17bb4e03522c1b3ef1d675ae60c5f0c2","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":16,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":16,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":16,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T21:03:23.615737Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T23:04:01.962523Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2203.13131","last_updated":"2022-03-24T15:44:50Z","snapshot_observed_at":"2026-08-06T19:08:21.390272Z","submitted_at":"2022-03-24T15:44:50Z","title":"Make-A-Scene: Scene-Based Text-to-Image Generation with Human Priors","version":1},"cited_work":{"arxiv_id":"2203.13131","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.13131","snapshot_observed_at":"2026-06-29T23:04:01.962523Z","title":"Make-a-Scene","venue":null,"work_id":"2c99d6c4-d1c6-4714-95e0-006639b9ac5c","year":2022},"citing_paper":{"arxiv_id":"2112.10752","last_updated":"2022-04-13T11:38:44Z","snapshot_observed_at":"2026-07-06T12:20:47.369918Z","submitted_at":"2021-12-20T18:55:25Z","title":"High-Resolution Image Synthesis with Latent Diffusion Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-11T22:02:09.899347Z"},"links":{"cited_paper":"/paper/2203.13131","citing_paper":"/paper/2112.10752"},"observation_digest":"sha256:8456566c5fea0ed3b3e0b8db5bf1647977bf8adce8afb461b3da3c019434c01f","observation_id":"17a15ade-d7d2-41dd-9c9f-51699fc5eea9","resolution":{"observed_at":"2026-05-11T22:02:10.163577Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.13131","last_updated":"2022-03-24T15:44:50Z","snapshot_observed_at":"2026-08-06T19:08:21.390272Z","submitted_at":"2022-03-24T15:44:50Z","title":"Make-A-Scene: Scene-Based Text-to-Image Generation with Human Priors","version":1},"cited_work":{"arxiv_id":"2203.13131","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.13131","snapshot_observed_at":"2026-06-29T23:04:01.962523Z","title":"Make-a-Scene","venue":null,"work_id":"2c99d6c4-d1c6-4714-95e0-006639b9ac5c","year":2022},"citing_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T16:55:57.612364Z"},"links":{"cited_paper":"/paper/2203.13131","citing_paper":"/paper/2204.06125"},"observation_digest":"sha256:c98baa276102aae7f5dfdcfcbefcc67467163debfb484f4af8b257fe07101087","observation_id":"8628b0d2-3651-4406-8016-f1f5052a6b1e","resolution":{"observed_at":"2026-05-10T16:55:57.716963Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.13131","last_updated":"2022-03-24T15:44:50Z","snapshot_observed_at":"2026-08-06T19:08:21.390272Z","submitted_at":"2022-03-24T15:44:50Z","title":"Make-A-Scene: Scene-Based Text-to-Image Generation with Human Priors","version":1},"cited_work":{"arxiv_id":"2203.13131","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.13131","snapshot_observed_at":"2026-06-29T23:04:01.962523Z","title":"Make-a-Scene","venue":null,"work_id":"2c99d6c4-d1c6-4714-95e0-006639b9ac5c","year":2022},"citing_paper":{"arxiv_id":"2205.11487","last_updated":"2022-05-23T17:42:53Z","snapshot_observed_at":"2026-07-06T13:12:59.688989Z","submitted_at":"2022-05-23T17:42:53Z","title":"Photorealistic Text-to-Image Diffusion Models with Deep Language Understanding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-12T07:38:53.056362Z"},"links":{"cited_paper":"/paper/2203.13131","citing_paper":"/paper/2205.11487"},"observation_digest":"sha256:aa890aad4d1d1a2d290bb431d302ca41ef62088b11dd1e584ca8d17ee0070f05","observation_id":"42d8bd7a-bb9e-48c7-8223-a78aec1d9517","resolution":{"observed_at":"2026-05-12T07:38:53.399476Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.13131","last_updated":"2022-03-24T15:44:50Z","snapshot_observed_at":"2026-08-06T19:08:21.390272Z","submitted_at":"2022-03-24T15:44:50Z","title":"Make-A-Scene: Scene-Based Text-to-Image Generation with Human Priors","version":1},"cited_work":{"arxiv_id":"2203.13131","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.13131","snapshot_observed_at":"2026-06-29T23:04:01.962523Z","title":"Make-a-Scene","venue":null,"work_id":"2c99d6c4-d1c6-4714-95e0-006639b9ac5c","year":2022},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"cited_paper":"/paper/2203.13131","citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:bc37c013a88a3cfd1c8a9e8d3f3ffac9c3232f3dd7726d6291b2e973805b319e","observation_id":"69afec39-e1a1-4aad-8f38-061e7d1ca95f","resolution":{"observed_at":"2026-05-12T04:49:31.051437Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.13131","last_updated":"2022-03-24T15:44:50Z","snapshot_observed_at":"2026-08-06T19:08:21.390272Z","submitted_at":"2022-03-24T15:44:50Z","title":"Make-A-Scene: Scene-Based Text-to-Image Generation with Human Priors","version":1},"cited_work":{"arxiv_id":"2203.13131","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.13131","snapshot_observed_at":"2026-06-29T23:04:01.962523Z","title":"Make-a-Scene","venue":null,"work_id":"2c99d6c4-d1c6-4714-95e0-006639b9ac5c","year":2022},"citing_paper":{"arxiv_id":"2208.01626","last_updated":"2022-08-02T17:55:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-02T17:55:41Z","title":"Prompt-to-Prompt Image Editing with Cross Attention Control","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-11T07:00:01.154743Z"},"links":{"cited_paper":"/paper/2203.13131","citing_paper":"/paper/2208.01626"},"observation_digest":"sha256:6c79ec5799702dcfb6e9ec0c867be6f6ed82071d524158e3d38ffc285b86c3c1","observation_id":"34a4a8bd-fd6e-488b-9688-f024a5810660","resolution":{"observed_at":"2026-05-11T07:00:01.514550Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.13131","last_updated":"2022-03-24T15:44:50Z","snapshot_observed_at":"2026-08-06T19:08:21.390272Z","submitted_at":"2022-03-24T15:44:50Z","title":"Make-A-Scene: Scene-Based Text-to-Image Generation with Human Priors","version":1},"cited_work":{"arxiv_id":"2203.13131","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.13131","snapshot_observed_at":"2026-06-29T23:04:01.962523Z","title":"Make-a-Scene","venue":null,"work_id":"2c99d6c4-d1c6-4714-95e0-006639b9ac5c","year":2022},"citing_paper":{"arxiv_id":"2209.14792","last_updated":"2022-09-29T13:59:46Z","snapshot_observed_at":"2026-07-06T13:57:47.051387Z","submitted_at":"2022-09-29T13:59:46Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-11T01:13:03.213358Z"},"links":{"cited_paper":"/paper/2203.13131","citing_paper":"/paper/2209.14792"},"observation_digest":"sha256:0b5fef35124400d36f192b7718c52281c3f40c161721e792e8eac6c94a952c8b","observation_id":"e1def9de-ccba-4988-b46f-8057a4b47479","resolution":{"observed_at":"2026-05-11T01:13:03.268349Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.13131","last_updated":"2022-03-24T15:44:50Z","snapshot_observed_at":"2026-08-06T19:08:21.390272Z","submitted_at":"2022-03-24T15:44:50Z","title":"Make-A-Scene: Scene-Based Text-to-Image Generation with Human Priors","version":1},"cited_work":{"arxiv_id":"2203.13131","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.13131","snapshot_observed_at":"2026-06-29T23:04:01.962523Z","title":"Make-a-Scene","venue":null,"work_id":"2c99d6c4-d1c6-4714-95e0-006639b9ac5c","year":2022},"citing_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-15T01:44:22.710205Z"},"links":{"cited_paper":"/paper/2203.13131","citing_paper":"/paper/2211.01324"},"observation_digest":"sha256:e7b0a250df265c8ea5af65e2a5766aa019447b6accf9c1db7a6acd33282e1659","observation_id":"ed82296c-576b-4c67-870b-f8a6d783e25f","resolution":{"observed_at":"2026-05-15T01:44:22.771350Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.13131","last_updated":"2022-03-24T15:44:50Z","snapshot_observed_at":"2026-08-06T19:08:21.390272Z","submitted_at":"2022-03-24T15:44:50Z","title":"Make-A-Scene: Scene-Based Text-to-Image Generation with Human Priors","version":1},"cited_work":{"arxiv_id":"2203.13131","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.13131","snapshot_observed_at":"2026-06-29T23:04:01.962523Z","title":"Make-a-Scene","venue":null,"work_id":"2c99d6c4-d1c6-4714-95e0-006639b9ac5c","year":2022},"citing_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-11T08:22:03.403362Z"},"links":{"cited_paper":"/paper/2203.13131","citing_paper":"/paper/2304.08485"},"observation_digest":"sha256:cfa66fd580eb0064e6ae304aa2f28ab9eb1c491c75080739390e621d7c4c0f58","observation_id":"b7ab1f25-669e-4a4d-937f-4e6bcb000f4c","resolution":{"observed_at":"2026-05-11T08:22:03.728483Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.13131","last_updated":"2022-03-24T15:44:50Z","snapshot_observed_at":"2026-08-06T19:08:21.390272Z","submitted_at":"2022-03-24T15:44:50Z","title":"Make-A-Scene: Scene-Based Text-to-Image Generation with Human Priors","version":1},"cited_work":{"arxiv_id":"2203.13131","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.13131","snapshot_observed_at":"2026-06-29T23:04:01.962523Z","title":"Make-a-Scene","venue":null,"work_id":"2c99d6c4-d1c6-4714-95e0-006639b9ac5c","year":2022},"citing_paper":{"arxiv_id":"2305.02463","last_updated":"2023-05-03T23:59:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-03T23:59:13Z","title":"Shap-E: Generating Conditional 3D Implicit Functions","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-16T15:32:06.563955Z"},"links":{"cited_paper":"/paper/2203.13131","citing_paper":"/paper/2305.02463"},"observation_digest":"sha256:2b823d063918161df09ca758c19bb5cc2ea65df87527018ec122a30f930fa72e","observation_id":"79d8d55d-a167-445d-ac29-5518b73e014d","resolution":{"observed_at":"2026-05-16T15:32:06.740762Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.13131","last_updated":"2022-03-24T15:44:50Z","snapshot_observed_at":"2026-08-06T19:08:21.390272Z","submitted_at":"2022-03-24T15:44:50Z","title":"Make-A-Scene: Scene-Based Text-to-Image Generation with Human Priors","version":1},"cited_work":{"arxiv_id":"2203.13131","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.13131","snapshot_observed_at":"2026-06-29T23:04:01.962523Z","title":"Make-a-Scene","venue":null,"work_id":"2c99d6c4-d1c6-4714-95e0-006639b9ac5c","year":2022},"citing_paper":{"arxiv_id":"2308.08089","last_updated":"2023-08-16T01:43:41Z","snapshot_observed_at":"2026-07-06T16:06:38.424057Z","submitted_at":"2023-08-16T01:43:41Z","title":"DragNUWA: Fine-grained Control in Video Generation by Integrating Text, Image, and Trajectory","version":1},"reference_index":244,"source":"arxiv_source","source_observed_at":"2026-05-20T13:03:57.828598Z"},"links":{"cited_paper":"/paper/2203.13131","citing_paper":"/paper/2308.08089"},"observation_digest":"sha256:8a714732cdaaa3c939ad9a37936fc191bde7db78731bb20fa0b9868d6f1cfb75","observation_id":"b20c9735-a372-460f-a71d-1069a8275e84","resolution":{"observed_at":"2026-05-20T13:03:58.150297Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.13131","last_updated":"2022-03-24T15:44:50Z","snapshot_observed_at":"2026-08-06T19:08:21.390272Z","submitted_at":"2022-03-24T15:44:50Z","title":"Make-A-Scene: Scene-Based Text-to-Image Generation with Human Priors","version":1},"cited_work":{"arxiv_id":"2203.13131","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.13131","snapshot_observed_at":"2026-06-29T23:04:01.962523Z","title":"Make-a-Scene","venue":null,"work_id":"2c99d6c4-d1c6-4714-95e0-006639b9ac5c","year":2022},"citing_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-07T22:11:30.869700Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-11T10:03:27.919346Z"},"links":{"cited_paper":"/paper/2203.13131","citing_paper":"/paper/2405.09818"},"observation_digest":"sha256:e6d8499c1237b92d99b62a7a832b6c0eb87e6a9ec1be8f689aefb9d469b35c87","observation_id":"9bf17676-6f02-4ced-8729-26629bfa3760","resolution":{"observed_at":"2026-05-11T10:03:28.051369Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.13131","last_updated":"2022-03-24T15:44:50Z","snapshot_observed_at":"2026-08-06T19:08:21.390272Z","submitted_at":"2022-03-24T15:44:50Z","title":"Make-A-Scene: Scene-Based Text-to-Image Generation with Human Priors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.13131","snapshot_observed_at":"2026-08-08T21:03:23.615737Z","title":"Make-a-scene: Scene-based text-to-image generation with human priors, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.04923","last_updated":"2025-02-07T13:41:51Z","snapshot_observed_at":"2026-08-08T20:55:55.679816Z","submitted_at":"2025-02-07T13:41:51Z","title":"Cached Multi-Lora Composition for Multi-Concept Image Generation","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-08T21:03:23.615737Z"},"links":{"cited_paper":"/paper/2203.13131","citing_paper":"/paper/2502.04923"},"observation_digest":"sha256:3112585c9c68202a1fa19960db5b1db8cf54203d3723f78a53f6726f3501fba6","observation_id":"64cde2e2-49af-4cb3-9f2a-7d0a9de71ac5","resolution":{"observed_at":"2026-08-08T21:03:23.615737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.13131","last_updated":"2022-03-24T15:44:50Z","snapshot_observed_at":"2026-08-06T19:08:21.390272Z","submitted_at":"2022-03-24T15:44:50Z","title":"Make-A-Scene: Scene-Based Text-to-Image Generation with Human Priors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.13131","snapshot_observed_at":"2026-08-07T06:02:59.560240Z","title":"Make-a-scene: Scene-based text-to-image generation with human priors","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06276","last_updated":"2025-06-06T17:58:39Z","snapshot_observed_at":"2026-08-08T06:15:04.945610Z","submitted_at":"2025-06-06T17:58:39Z","title":"STARFlow: Scaling Latent Normalizing Flows for High-resolution Image Synthesis","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:59.560240Z"},"links":{"cited_paper":"/paper/2203.13131","citing_paper":"/paper/2506.06276"},"observation_digest":"sha256:20f57ef57ce7ea792a4f296cdc6f59a3bc37bfd27aeab36ecf02245b3a4ff090","observation_id":"5a7b3cea-6c0e-4375-a1a1-21d554c2d08c","resolution":{"observed_at":"2026-08-07T06:02:59.560240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.13131","last_updated":"2022-03-24T15:44:50Z","snapshot_observed_at":"2026-08-06T19:08:21.390272Z","submitted_at":"2022-03-24T15:44:50Z","title":"Make-A-Scene: Scene-Based Text-to-Image Generation with Human Priors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.13131","snapshot_observed_at":"2026-08-06T21:48:52.182184Z","title":"Make-a-scene: Scene-based text-to-image generation with human priors, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:52.182184Z"},"links":{"cited_paper":"/paper/2203.13131","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:e3718f21542577e0b66356dcead71205cf379d2d51c35fea6916fca1f141c96d","observation_id":"6e88afe7-aa0c-466e-b77f-134e9213febc","resolution":{"observed_at":"2026-08-06T21:48:52.182184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.13131","last_updated":"2022-03-24T15:44:50Z","snapshot_observed_at":"2026-08-06T19:08:21.390272Z","submitted_at":"2022-03-24T15:44:50Z","title":"Make-A-Scene: Scene-Based Text-to-Image Generation with Human Priors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.13131","snapshot_observed_at":"2026-08-06T19:18:49.855080Z","title":"Make-A-Scene: Scene- based text-to-image generation with human pri- ors,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.06033","last_updated":"2025-07-08T14:35:02Z","snapshot_observed_at":"2026-08-08T00:52:55.228538Z","submitted_at":"2025-07-08T14:35:02Z","title":"TextPixs: Glyph-Conditioned Diffusion with Character-Aware Attention and OCR-Guided Supervision","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T19:18:49.855080Z"},"links":{"cited_paper":"/paper/2203.13131","citing_paper":"/paper/2507.06033"},"observation_digest":"sha256:9e3e164c251dfad83442762d455b220267d3bad41b13113285a6bc24a26fe490","observation_id":"2412b760-f18d-47cd-b1b8-09ebfe517144","resolution":{"observed_at":"2026-08-06T19:18:49.855080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.13131","last_updated":"2022-03-24T15:44:50Z","snapshot_observed_at":"2026-08-06T19:08:21.390272Z","submitted_at":"2022-03-24T15:44:50Z","title":"Make-A-Scene: Scene-Based Text-to-Image Generation with Human Priors","version":1},"cited_work":{"arxiv_id":"2203.13131","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.13131","snapshot_observed_at":"2026-06-29T23:04:01.962523Z","title":"Make-a-Scene","venue":null,"work_id":"2c99d6c4-d1c6-4714-95e0-006639b9ac5c","year":2022},"citing_paper":{"arxiv_id":"2605.25343","last_updated":"2026-05-25T01:57:43Z","snapshot_observed_at":"2026-07-06T23:35:16.647496Z","submitted_at":"2026-05-25T01:57:43Z","title":"Toward Native Multimodal Modeling: A Roadmap","version":1},"reference_index":181,"source":"pdf_text","source_observed_at":"2026-06-29T22:58:38.610609Z"},"links":{"cited_paper":"/paper/2203.13131","citing_paper":"/paper/2605.25343"},"observation_digest":"sha256:9202cb818601583b908f798fb0b51e45174c8e39e57d2114733506d30086d413","observation_id":"6885816a-f5e8-4510-bb7f-51db2d534a36","resolution":{"observed_at":"2026-06-29T23:04:01.964697Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2203.13131/citation-record","integrity":"/paper/2203.13131/integrity","json":"/paper/2203.13131/citation-record.json","paper":"/paper/2203.13131"},"outbound":[],"paper":{"arxiv_id":"2203.13131","last_updated":"2022-03-24T15:44:50Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T19:08:21.390272Z","submitted_at":"2022-03-24T15:44:50Z","title":"Make-A-Scene: Scene-Based Text-to-Image Generation with Human Priors"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 16 inbound Pith citation observations for arXiv:2203.13131."}