{"as_of":"2026-08-18T00:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d07916d49670fe05ad9888d68ddf0404e6f5a7e76ea50db3ada1d3564452be7a","coverage":[{"denominator":69,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":69,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:21:27.112050Z","state":"measured"},{"denominator":73,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":73,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T10:10:09.300722Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T13:09:50.420268Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-14T02:14:48.628979Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"cited_work":{"arxiv_id":"2505.24870","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.24870","snapshot_observed_at":"2026-07-04T13:09:50.420268Z","title":"Genspace: Bench- marking spatially-aware image generation","venue":null,"work_id":"ff323a8a-b684-40e5-9b2f-753d10068972","year":2025},"citing_paper":{"arxiv_id":"2604.20570","last_updated":"2026-04-22T13:50:00Z","snapshot_observed_at":"2026-08-11T06:12:30.304597Z","submitted_at":"2026-04-22T13:50:00Z","title":"Exploring Spatial Intelligence from a Generative Perspective","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T00:45:46.261005Z"},"links":{"cited_paper":"/paper/2505.24870","citing_paper":"/paper/2604.20570"},"observation_digest":"sha256:a00c9e17c10d169f9c93e8d943099a92d58692d22902308b9b4e59e0aa372a79","observation_id":"74f31468-8f91-4b76-b3e6-4ac6cdbab895","resolution":{"observed_at":"2026-05-10T00:49:48.814426Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-14T02:14:48.628979Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"cited_work":{"arxiv_id":"2505.24870","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.24870","snapshot_observed_at":"2026-07-04T13:09:50.420268Z","title":"Genspace: Bench- marking spatially-aware image generation","venue":null,"work_id":"ff323a8a-b684-40e5-9b2f-753d10068972","year":2025},"citing_paper":{"arxiv_id":"2604.26341","last_updated":"2026-04-29T06:46:59Z","snapshot_observed_at":"2026-08-13T14:53:17.732860Z","submitted_at":"2026-04-29T06:46:59Z","title":"SpatialFusion: Endowing Unified Image Generation with Intrinsic 3D Geometric Awareness","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-07T13:45:53.346402Z"},"links":{"cited_paper":"/paper/2505.24870","citing_paper":"/paper/2604.26341"},"observation_digest":"sha256:f4cfaa9c3642fb652b23634df4fbbfacb10f9d02bcbd8b6dcf3e491b144a0493","observation_id":"e353140e-f05d-46e4-90d7-b64f3dd3f317","resolution":{"observed_at":"2026-05-12T08:46:26.895339Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-14T02:14:48.628979Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"cited_work":{"arxiv_id":"2505.24870","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.24870","snapshot_observed_at":"2026-07-04T13:09:50.420268Z","title":"Genspace: Bench- marking spatially-aware image generation","venue":null,"work_id":"ff323a8a-b684-40e5-9b2f-753d10068972","year":2025},"citing_paper":{"arxiv_id":"2606.26738","last_updated":"2026-07-15T11:15:44Z","snapshot_observed_at":"2026-08-12T22:11:57.422164Z","submitted_at":"2026-06-25T08:20:34Z","title":"Do Image Editing Models Understand Lighting?","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-26T05:29:42.024146Z"},"links":{"cited_paper":"/paper/2505.24870","citing_paper":"/paper/2606.26738"},"observation_digest":"sha256:cc163895176c9c61193de7434e7c13e6f5565a63cbd4e5a3f48dbb25a998274f","observation_id":"027d0472-c21d-4c93-b7db-da8451aa30b8","resolution":{"observed_at":"2026-07-04T13:09:50.422178Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-14T02:14:48.628979Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24870","snapshot_observed_at":"2026-08-02T10:10:09.300722Z","title":"Genspace: Benchmarking spatially-aware image generation.arXiv preprint arXiv:2505.24870, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.26738","last_updated":"2026-07-15T11:15:44Z","snapshot_observed_at":"2026-08-12T22:11:57.422164Z","submitted_at":"2026-06-25T08:20:34Z","title":"Do Image Editing Models Understand Lighting?","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-02T10:10:09.300722Z"},"links":{"cited_paper":"/paper/2505.24870","citing_paper":"/paper/2606.26738"},"observation_digest":"sha256:ec9f154dbd68e2db03b6f73f790bc18b4e143a50d5cc8907c6291424c50bb81a","observation_id":"0c9af7a1-ec47-4037-8f84-421a4a828f92","resolution":{"observed_at":"2026-08-02T10:10:09.300722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.24870/citation-record","integrity":"/paper/2505.24870/integrity","json":"/paper/2505.24870/citation-record.json","paper":"/paper/2505.24870"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:20.139959Z","title":"Univ of California Press, 1972","venue":null,"work_id":null,"year":1972},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-14T02:14:48.628979Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:20.139959Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:6f58067c3d24c61f646ad7ca72b08d46c9fac956af228d0100f9e69b8faf4b83","observation_id":"b46af2fd-fbb0-42e1-92d6-c575cc83a5d9","resolution":{"observed_at":"2026-08-07T12:21:20.139959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:31.733343Z","title":"artificialanalysis, 2025","venue":null,"work_id":"5933340b-9991-4763-bd10-99ef40f6ac17","year":2025},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-14T02:14:48.628979Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:20.280978Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:7cbd94f85d93131eaea1c325521f8075af7877f99246be8449dfcdd546d7d33c","observation_id":"cfdd0717-c7bf-4037-ba62-4d21abcb9792","resolution":{"observed_at":"2026-08-07T12:21:31.805827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T12:21:20.380572Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-14T02:14:48.628979Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:20.380572Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:da2b7ae5d502f22466e09982c55b49cb4dd4a75628508cdc66dd9a07cf4ad65e","observation_id":"6f9e14a5-2366-4fab-88a5-30bdeb56c20a","resolution":{"observed_at":"2026-08-07T12:21:20.380572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:31.539173Z","title":"The state of the art of spatial interfaces for 3d visualization","venue":null,"work_id":"35d3dd58-8c9c-4259-9dc7-fe45aef4936a","year":2021},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-14T02:14:48.628979Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:20.471921Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:a86a1430eb8c1374e41e24c809e31e028b0aa8760c5a008b7bc409acec51109c","observation_id":"1f4a59bd-d0cb-48a8-a937-81c74179908a","resolution":{"observed_at":"2026-08-07T12:21:31.624662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:20.559724Z","title":"Improving image generation with better captions.Computer Science","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-14T02:14:48.628979Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:20.559724Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:2447dc77daa5fd2c09b33dedbc57e2d300dda01418c0836eddb9a31836de4462","observation_id":"16533d03-3ea7-4269-a335-7bd48ca13f95","resolution":{"observed_at":"2026-08-07T12:21:20.559724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:20.690901Z","title":"Instructpix2pix: Learning to follow image editing instructions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-14T02:14:48.628979Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:20.690901Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:5f136846dcf321d2dfafe467956fc531ebf65e2ed7ca4b96f7b842b77ca6b934","observation_id":"98caf435-875f-4f05-be14-bb37cb081ff7","resolution":{"observed_at":"2026-08-07T12:21:20.690901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:20.776296Z","title":"Spatialvlm: Endowing vision-language models with spatial reasoning capabilities","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-14T02:14:48.628979Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:20.776296Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:35ebe86b3edfe83f78aa24121eea581f00bc879b60de59f7e978a8b2e1d7c7a8","observation_id":"448e6dee-853a-4972-b6fc-0995678be19c","resolution":{"observed_at":"2026-08-07T12:21:20.776296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01584","last_updated":"2024-10-15T01:16:20Z","snapshot_observed_at":"2026-08-16T13:46:36.421633Z","submitted_at":"2024-06-03T17:59:06Z","title":"SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01584","snapshot_observed_at":"2026-08-07T12:21:20.914495Z","title":"Spatialrgpt: Grounded spatial reasoning in vision language models.arXiv preprint arXiv:2406.01584, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-14T02:14:48.628979Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:20.914495Z"},"links":{"cited_paper":"/paper/2406.01584","citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:d95d79f450054d978811e0b0ba4f877a15a2694ee01cfcc41a9d6bf3ff10c4a6","observation_id":"eaf3a9d2-5463-4376-a6bc-5326c43abcfe","resolution":{"observed_at":"2026-08-07T12:21:20.914495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14683","last_updated":"2025-07-27T11:45:16Z","snapshot_observed_at":"2026-08-17T01:11:44.872398Z","submitted_at":"2025-05-20T17:59:30Z","title":"Emerging Properties in Unified Multimodal Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14683","snapshot_observed_at":"2026-08-07T12:21:21.025185Z","title":"Emerging properties in unified multimodal pretraining.arXiv preprint arXiv:2505.14683, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-14T02:14:48.628979Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:21.025185Z"},"links":{"cited_paper":"/paper/2505.14683","citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:121d2a3ae2c7922ee4693fae38b7c48f12f52d9ff44645a1709cd07f2e65ebc7","observation_id":"9c6e516c-9dcf-4d19-a551-e38fe52cd7e7","resolution":{"observed_at":"2026-08-07T12:21:21.025185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:21.163530Z","title":"Scaling rectified flow transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-14T02:14:48.628979Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:21.163530Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:1058b690eb9bae00ad950e07e9e829c9b0727a666fe70bd50b2ca3c1db23daa5","observation_id":"7d18ac92-a9f6-4c43-873b-89900e87456a","resolution":{"observed_at":"2026-08-07T12:21:21.163530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:31.355776Z","title":"Routledge, 2017","venue":null,"work_id":"2495d56b-4374-43b7-97a6-11df1974a2e2","year":2017},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-14T02:14:48.628979Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:21.321145Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:13591758fa2ca66c9c8976ac5d2f0cda71fb064a6152056639c791a5c1c68380","observation_id":"75df68fc-7fed-43f7-b2bb-caf9d7928da4","resolution":{"observed_at":"2026-08-07T12:21:31.437732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07546","last_updated":"2024-08-12T19:33:52Z","snapshot_observed_at":"2026-08-16T13:44:03.034288Z","submitted_at":"2024-06-11T17:59:48Z","title":"Commonsense-T2I Challenge: Can Text-to-Image Generation Models Understand Commonsense?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07546","snapshot_observed_at":"2026-08-07T12:21:21.501770Z","title":"Commonsense-t2i challenge: Can text-to-image generation models understand commonsense?arXiv preprint arXiv:2406.07546, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-14T02:14:48.628979Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:21.501770Z"},"links":{"cited_paper":"/paper/2406.07546","citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:8911a50a0ede315e89e15465993ac56c2cb0380dd09a6d3bac405034408a0bd2","observation_id":"5042c595-d8b2-4957-8d6e-e989a06c2c7b","resolution":{"observed_at":"2026-08-07T12:21:21.501770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11346","last_updated":"2025-06-28T11:46:35Z","snapshot_observed_at":"2026-08-16T15:39:15.923412Z","submitted_at":"2025-04-15T16:19:07Z","title":"Seedream 3.0 Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11346","snapshot_observed_at":"2026-08-07T12:21:21.642710Z","title":"Seedream 3.0 technical report.arXiv preprint arXiv:2504.11346, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-14T02:14:48.628979Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:21.642710Z"},"links":{"cited_paper":"/paper/2504.11346","citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:492a6a2edebb05ab01eb4a356dfdc1fac3a1cdb402cd9581264722e967087bcb","observation_id":"8e498051-2301-4bdb-b254-b046d6132a46","resolution":{"observed_at":"2026-08-07T12:21:21.642710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:31.172215Z","title":"Interaction strategies for effective augmented reality geo-visualization: Insights from spatial cognition.Human–Computer Interaction, 36(2): 107–149, 2021","venue":null,"work_id":"edad27bf-13f6-4510-90dc-8119cd1f76dd","year":2021},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-14T02:14:48.628979Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:21.761934Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:4e1c6e402e762c6a805204da9cd5b70b61aea3855ef7eb960ba616dd609c9a3b","observation_id":"c5fe5d6f-44f1-43fe-9589-ab1349030bfd","resolution":{"observed_at":"2026-08-07T12:21:31.281855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:21.902276Z","title":"Geneval: An object-focused framework for evaluating text-to-image alignment.Advances in Neural Information Processing Systems, 36:52132–52152, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-14T02:14:48.628979Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:21.902276Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:45d39fa081dd068a8d0abf1cb6bcfdc237e8f5218d6e864f5511eae98c78e768","observation_id":"54641fec-4982-4259-992d-f56ea187a7a7","resolution":{"observed_at":"2026-08-07T12:21:21.902276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:30.941955Z","title":"Gemini-2.0-flash, 2025","venue":null,"work_id":"567ffcb2-1509-4f49-9860-91f8bb38ef8a","year":2025},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-14T02:14:48.628979Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:22.040641Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:aec0677c2a1ca5f99d4078cb9f38eb2700f0ddd97e57763767640b8ee90abf44","observation_id":"200400af-27cf-4f8a-a99f-cb20d10f8f09","resolution":{"observed_at":"2026-08-07T12:21:31.051201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:30.838964Z","title":"Gemini-2.5-pro, 2025.https://deepmind.google/technologies/gemini/pro/","venue":null,"work_id":"98fb9599-485b-4792-b8a8-d7053e6b013c","year":2025},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-14T02:14:48.628979Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:22.151813Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:87cefbd1620574dcc870337849acad3f5c5c70726f66034747cb0af11014d72b","observation_id":"b99dd7ac-c942-44bb-b8cf-35172382d5a4","resolution":{"observed_at":"2026-08-07T12:21:30.870218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01626","last_updated":"2022-08-02T17:55:41Z","snapshot_observed_at":"2026-08-17T00:44:11.103098Z","submitted_at":"2022-08-02T17:55:41Z","title":"Prompt-to-Prompt Image Editing with Cross Attention Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01626","snapshot_observed_at":"2026-08-07T12:21:22.261946Z","title":"Prompt-to- prompt image editing with cross attention control.arXiv preprint arXiv:2208.01626, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-14T02:14:48.628979Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:22.261946Z"},"links":{"cited_paper":"/paper/2208.01626","citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:d32a3b85395e81075b4e9e0f32d21b5dc4396e0ce720b764dd7353ee4f61f603","observation_id":"c03f88bd-a509-44cc-9470-9b040d18bf9d","resolution":{"observed_at":"2026-08-07T12:21:22.261946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:22.355100Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilibrium.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-14T02:14:48.628979Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:22.355100Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:40c66584463f612aeddb2514979cda379d1f35e835dc5a10c357b1afeb09d832","observation_id":"6bdeaf89-f347-41ab-9c82-7d19a165efa7","resolution":{"observed_at":"2026-08-07T12:21:22.355100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:22.439109Z","title":"T2i-compbench: A comprehensive benchmark for open-world compositional text-to-image generation.Advances in Neural Information Processing Systems, 36:78723–78747, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-14T02:14:48.628979Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:22.439109Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:f70ffa7a362de43d2c3e4d51d106284b840edc94c5c89afbee5f596dcd6fb270","observation_id":"efda6c62-e141-41bb-9935-f449b285812a","resolution":{"observed_at":"2026-08-07T12:21:22.439109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:30.621789Z","title":"T2i-compbench++: An enhanced and comprehensive benchmark for compositional text-to-image generation.IEEE Transactions on Pattern Analysis and Machine Intelligence, 2025","venue":null,"work_id":"776e5f95-dab7-4f16-877b-3600cfd98b5b","year":2025},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-14T02:14:48.628979Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:22.579998Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:68c1d658be224ae6f7eca923b77936cd501fda6f3bbb7bbc1d8c56c0b49e5ad7","observation_id":"39b547ff-6312-48e7-a7e4-d2e7910423f7","resolution":{"observed_at":"2026-08-07T12:21:30.690958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.09778","last_updated":"2023-02-22T02:14:55Z","snapshot_observed_at":"2026-08-16T15:54:13.649659Z","submitted_at":"2023-02-20T05:48:41Z","title":"Composer: Creative and Controllable Image Synthesis with Composable Conditions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.09778","snapshot_observed_at":"2026-08-07T12:21:22.689695Z","title":"Composer: Creative and controllable image synthesis with composable conditions.arXiv preprint arXiv:2302.09778, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-14T02:14:48.628979Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:22.689695Z"},"links":{"cited_paper":"/paper/2302.09778","citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:02a62d9011d1191eddeda03b36977fc574752b68a46fdcb0079f9a50f1f6a98f","observation_id":"29bd3261-7207-4e99-acb3-46205719e5cf","resolution":{"observed_at":"2026-08-07T12:21:22.689695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:30.447205Z","title":"Perspective fields for single image camera calibration","venue":null,"work_id":"81df18f6-ddc6-4d84-80e4-6f625ebbe86c","year":2023},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-14T02:14:48.628979Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:22.790244Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:1b8fdf725ac4982e0004ae42c6fb3c7c7735615d8f314742d996f8cfe0c3b404","observation_id":"be4a7820-a7d8-41e3-8cde-fc27da6bb05d","resolution":{"observed_at":"2026-08-07T12:21:30.510813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:22.902732Z","title":"Segment anything","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-14T02:14:48.628979Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:22.902732Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:dfcbca720d45e05c3a23a005009c87bbdef20966a33a252b1b6b62fc9c3b5486","observation_id":"c846080e-c2a4-4324-87e1-1924d2fbd59b","resolution":{"observed_at":"2026-08-07T12:21:22.902732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:23.002591Z","title":"Pick-a- pic: An open dataset of user preferences for text-to-image generation.Advances in Neural Information Processing Systems, 36:36652–36663, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-14T02:14:48.628979Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:23.002591Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:6b1bd1d5f6a823afa9616e54393a367a2d057e1088420995c57402e515428967","observation_id":"f9390b6f-1d6e-4fe7-ad0f-8c14b5529d29","resolution":{"observed_at":"2026-08-07T12:21:23.002591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:23.095767Z","title":"Flux.https://github.com/black-forest-labs/flux, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-14T02:14:48.628979Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:23.095767Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:fba42424a80fa7b0a87e7f0dc5111ea2bee7a9d9d2d7f54c3fb068ae3779c06d","observation_id":"810b3a23-5e6f-49ab-9835-2a12b4fd7227","resolution":{"observed_at":"2026-08-07T12:21:23.095767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-07T12:21:23.182573Z","title":"Hunyuan-dit: A powerful multi-resolution diffusion transformer with fine-grained chinese understanding.arXiv preprint arXiv:2405.08748, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-14T02:14:48.628979Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:23.182573Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:5d86384da7c6dab576e6495873ccee358c8175a76f8569f900c9a4dd49e5f6d4","observation_id":"0ba3e372-9816-449e-8acf-d4a831eb2ab6","resolution":{"observed_at":"2026-08-07T12:21:23.182573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:30.301179Z","title":"Evaluating text-to-visual generation with image-to-text generation","venue":null,"work_id":"5d8c5d33-418d-432d-893c-76b5cf743880","year":2024},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-14T02:14:48.628979Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:23.279789Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:9930fef892b5c69a5deed89db40eab5dba4a073e473ec14bcc483c45886bd56a","observation_id":"75e43270-0f7d-43fe-b33c-56179ae1806c","resolution":{"observed_at":"2026-08-07T12:21:30.331628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-16T02:30:42.660030Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-07T12:21:23.379583Z","title":"Flow matching for generative modeling.arXiv preprint arXiv:2210.02747, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-14T02:14:48.628979Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:23.379583Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:77acc7550fcc0072054bbb65ee1bdc1e759a1d5bb66e1bb7e8868f591cdb3eda","observation_id":"eafc1697-b812-446d-afac-e42599339342","resolution":{"observed_at":"2026-08-07T12:21:23.379583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:23.430712Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-14T02:14:48.628979Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:23.430712Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:77254b354e4b494433608e265c8bd874e255104e362a177695a88a187f06b1bd","observation_id":"73cc255d-0bb3-46b4-8804-2be266a7ceba","resolution":{"observed_at":"2026-08-07T12:21:23.430712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11817","last_updated":"2025-03-02T07:05:19Z","snapshot_observed_at":"2026-08-16T13:09:05.451945Z","submitted_at":"2024-10-15T17:46:31Z","title":"Improving Long-Text Alignment for Text-to-Image Diffusion Models","version":2},"cited_work":{"arxiv_id":"2410.11817","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.11817","snapshot_observed_at":"2026-08-07T12:21:27.598172Z","title":"Improving Long-Text Alignment for Text-to-Image Diffusion Models","venue":"cs.CV","work_id":"3aa5051b-6010-4c3f-b365-ba2e9cf64081","year":2024},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-14T02:14:48.628979Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:23.564403Z"},"links":{"cited_paper":"/paper/2410.11817","citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:cca3e40a8555a9d1d570f4e64c774c70cc2643394405164622dc89b5589fcacc","observation_id":"ba8a2a71-5919-499c-b7fd-d1cef9bbb745","resolution":{"observed_at":"2026-08-07T12:21:27.679632Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:23.656105Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-14T02:14:48.628979Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:23.656105Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:1095662a4f765529c414c20257e50b32edaed20978ed68f40efcc9906620fe79","observation_id":"e8eec2dc-570e-4570-98ed-b82966dfe8b8","resolution":{"observed_at":"2026-08-07T12:21:23.656105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.17761","last_updated":"2025-07-31T05:05:45Z","snapshot_observed_at":"2026-08-15T10:26:22.896514Z","submitted_at":"2025-04-24T17:25:12Z","title":"Step1X-Edit: A Practical Framework for General Image Editing","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.17761","snapshot_observed_at":"2026-08-07T12:21:23.733768Z","title":"Step1x-edit: A practical framework for general image editing.arXiv preprint arXiv:2504.17761, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-14T02:14:48.628979Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:23.733768Z"},"links":{"cited_paper":"/paper/2504.17761","citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:a6c79b3cdf307060625ca1ac1eb715a6848c7c98e49c35b34d7c4ecd438ae2ef","observation_id":"2b7cc815-f909-4904-80e2-ef49e217350d","resolution":{"observed_at":"2026-08-07T12:21:23.733768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:23.836081Z","title":"3dsrbench: A comprehensive 3d spatial reasoning benchmark.arXiv preprint arXiv:2412.07825, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-14T02:14:48.628979Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:23.836081Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:e1fbb81e2c18b47e16db7a4c959a894372892533f4b0d56f8f48645461f7822f","observation_id":"216c5aed-8743-40a1-989c-89e5ed6623a3","resolution":{"observed_at":"2026-08-07T12:21:23.836081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11802","last_updated":"2024-09-21T06:53:58Z","snapshot_observed_at":"2026-08-16T13:42:08.485862Z","submitted_at":"2024-06-17T17:49:01Z","title":"PhyBench: A Physical Commonsense Benchmark for Evaluating Text-to-Image Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11802","snapshot_observed_at":"2026-08-07T12:21:23.919192Z","title":"Phybench: A physical commonsense benchmark for evaluating text-to-image models.arXiv preprint arXiv:2406.11802, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-14T02:14:48.628979Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:23.919192Z"},"links":{"cited_paper":"/paper/2406.11802","citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:2dfe44ee69ee18c76e699ee5168648c5668b721d268ded201f259d91aa2c10eb","observation_id":"c316e543-6c85-4442-af8e-b75ae5e6ae74","resolution":{"observed_at":"2026-08-07T12:21:23.919192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:30.034736Z","title":"Hands-free interaction in immersive virtual reality: A systematic review.IEEE Transactions on Visualization and Computer Graphics, 27(5):2702–2713, 2021","venue":null,"work_id":"104cdecd-643d-4d6f-afad-d1fe1ab4dc23","year":2021},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-14T02:14:48.628979Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:24.041361Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:0364d9223f87dc9cb77988a86f78e8b89b593f92cc903318dfd7877381ec4cd3","observation_id":"8cae6b39-964e-4e48-96cb-52b1f01eabe8","resolution":{"observed_at":"2026-08-07T12:21:30.152161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07265","last_updated":"2026-06-02T17:11:50Z","snapshot_observed_at":"2026-08-16T12:51:32.079370Z","submitted_at":"2025-03-10T12:47:53Z","title":"WISE: A World Knowledge-Informed Semantic Evaluation for Text-to-Image Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07265","snapshot_observed_at":"2026-08-07T12:21:24.138663Z","title":"Wise: A world knowledge-informed semantic evaluation for text-to-image generation.arXiv preprint arXiv:2503.07265, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-14T02:14:48.628979Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:24.138663Z"},"links":{"cited_paper":"/paper/2503.07265","citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:1ba654d8b012152c29f4a8476407d33cb69fd2b000ba78c50bb6f86352f1fb3f","observation_id":"3d441313-ed6c-4758-abb1-3e117e947a75","resolution":{"observed_at":"2026-08-07T12:21:24.138663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:29.796457Z","title":"Gpt-4o, 2025.https://openai.com/index/introducing-4o-image-generation/","venue":null,"work_id":"50c0237c-f587-43c3-b8d2-d4df99a2f215","year":2025},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-14T02:14:48.628979Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:24.226161Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:90ce97ad9477e00e4b26672b5b17ecbcebed1f1692a0695ebbf4a1cc0f493cfa","observation_id":"e5009608-ba5a-40b2-ab86-8a59f8085f66","resolution":{"observed_at":"2026-08-07T12:21:29.931517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:29.545429Z","title":"Gpt-o3, 2025.https://openai.com/index/introducing-o3-and-o4-mini/","venue":null,"work_id":"4f814c66-dbeb-4304-b280-5a4c0da7b88c","year":2025},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-14T02:14:48.628979Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:24.339565Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:26190e9c948e9a5531743a00e24886a87298c9c5030fa578e5d7272073742288","observation_id":"93bd714e-7be7-4162-bd35-8465ea7ce1d4","resolution":{"observed_at":"2026-08-07T12:21:29.688950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:29.263041Z","title":"Diffusion handles enabling 3d edits for diffusion models by lifting activations to 3d","venue":null,"work_id":"0dc85c24-d550-41f4-a70d-c77096db9101","year":2024},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-14T02:14:48.628979Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:24.436992Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:8fa4bc47799923af5bb68277ada52d96671d44b570dcc40d31499bbd493f3b32","observation_id":"1fa1556f-c724-4629-84c4-fd42fad2479a","resolution":{"observed_at":"2026-08-07T12:21:29.367092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:24.513458Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-14T02:14:48.628979Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:24.513458Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:8345460b4317a883dbcef54406e769fd6a7d328d2ca1b580ae6eae27458a344a","observation_id":"5138a52d-a751-4369-839f-59018ebc1c6f","resolution":{"observed_at":"2026-08-07T12:21:24.513458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-08-14T22:54:08.184266Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-07T12:21:24.611747Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis.arXiv preprint arXiv:2307.01952, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-14T02:14:48.628979Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:24.611747Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:837b2f97eed8918c6fb4921df433dc0544390231e80a6ec870b25c3623ea2a4b","observation_id":"724df505-a9df-475f-a883-23efe1c4a75f","resolution":{"observed_at":"2026-08-07T12:21:24.611747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:24.710721Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-14T02:14:48.628979Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:24.710721Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:a6c28062a944d102ad064ab0d86d29154ac1f96af9135a4478bf9b6b8ef719a1","observation_id":"975044c5-66b2-478a-b910-2082cae1b4fe","resolution":{"observed_at":"2026-08-07T12:21:24.710721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06468","last_updated":"2025-04-18T03:53:04Z","snapshot_observed_at":"2026-08-16T13:11:18.563373Z","submitted_at":"2024-10-09T01:41:49Z","title":"Does Spatial Cognition Emerge in Frontier Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06468","snapshot_observed_at":"2026-08-07T12:21:24.796187Z","title":"Does spatial cognition emerge in frontier models?arXiv preprint arXiv:2410.06468, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-14T02:14:48.628979Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:24.796187Z"},"links":{"cited_paper":"/paper/2410.06468","citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:08c4a498081778d840957757fce4dc2e90672b81190f3989bfb63c1a5ac799b2","observation_id":"89639ab5-5079-4828-a8dc-149077824f5a","resolution":{"observed_at":"2026-08-07T12:21:24.796187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-07T12:21:24.876288Z","title":"Sam 2: Segment anything in images and videos.arXiv preprint arXiv:2408.00714, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-14T02:14:48.628979Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:24.876288Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:718525c30277c16d1adac0da5346c6bb93e035ab0638ce352e1b8420643b15f9","observation_id":"65164d93-b13b-4d21-b6ce-9e5328f38f08","resolution":{"observed_at":"2026-08-07T12:21:24.876288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14159","last_updated":"2024-01-25T13:12:09Z","snapshot_observed_at":"2026-07-06T17:20:25.138890Z","submitted_at":"2024-01-25T13:12:09Z","title":"Grounded SAM: Assembling Open-World Models for Diverse Visual Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14159","snapshot_observed_at":"2026-08-07T12:21:24.946005Z","title":"Grounded sam: Assembling open-world models for diverse visual tasks.arXiv preprint arXiv:2401.14159, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-14T02:14:48.628979Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:24.946005Z"},"links":{"cited_paper":"/paper/2401.14159","citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:0fe9f0d3dda3b3abc1719a933913d711cfa51d1f2e32fee43dd3bf9c5d9f2043","observation_id":"f15429ec-5438-4ae4-a8f4-c415be0e5e19","resolution":{"observed_at":"2026-08-07T12:21:24.946005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:25.017477Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-14T02:14:48.628979Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:25.017477Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:a494835a6b56d983fc52cc43bd21fc1bbb683467ad0b7ed16e3b6f159924d6b2","observation_id":"3982acb9-1a81-41dd-a817-ec747de379eb","resolution":{"observed_at":"2026-08-07T12:21:25.017477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:25.090599Z","title":"Improved techniques for training gans.Advances in neural information processing systems, 29, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-14T02:14:48.628979Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:25.090599Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:9634f81c7d7235c3188003f66a585fd67f52dcd70ebfc9eb23e26820986ba718","observation_id":"7198bf91-2ed5-4f49-805e-485685938b60","resolution":{"observed_at":"2026-08-07T12:21:25.090599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:25.158919Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models.Advances in neural information processing systems, 35:25278–25294, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-14T02:14:48.628979Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:25.158919Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:75e146088ed9faa8fc5db72f222329328ab7b71253e7e5949387acc25fdc39c6","observation_id":"5179dcb2-693c-498c-938e-c587b1f80307","resolution":{"observed_at":"2026-08-07T12:21:25.158919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.06686","last_updated":"2024-11-11T03:06:26Z","snapshot_observed_at":"2026-08-16T13:01:19.263484Z","submitted_at":"2024-11-11T03:06:26Z","title":"SeedEdit: Align Image Re-Generation to Image Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.06686","snapshot_observed_at":"2026-08-07T12:21:25.265534Z","title":"Seededit: Align image re-generation to image editing.arXiv preprint arXiv:2411.06686, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-14T02:14:48.628979Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:25.265534Z"},"links":{"cited_paper":"/paper/2411.06686","citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:278a07069139742fa2c4fe9b862d6e69746d3fda39d355542997e38f64b798a5","observation_id":"55761e5b-7922-4a03-bc9e-c880f61dcb1f","resolution":{"observed_at":"2026-08-07T12:21:25.265534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.07664","last_updated":"2024-11-12T09:30:02Z","snapshot_observed_at":"2026-08-16T13:45:35.645162Z","submitted_at":"2024-11-12T09:30:02Z","title":"Evaluating the Generation of Spatial Relations in Text and Image Generative Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.07664","snapshot_observed_at":"2026-08-07T12:21:25.344505Z","title":"Evaluating the generation of spatial relations in text and image generative models.arXiv preprint arXiv:2411.07664, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-14T02:14:48.628979Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:25.344505Z"},"links":{"cited_paper":"/paper/2411.07664","citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:4f415aec6e69608c60ef22fd104f09584467e80b12e770d75f539528e1265a1d","observation_id":"f4f0165d-14c5-4572-8790-18a320b70af9","resolution":{"observed_at":"2026-08-07T12:21:25.344505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13456","last_updated":"2021-02-10T18:17:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-11-26T19:39:10Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.13456","snapshot_observed_at":"2026-08-07T12:21:25.420657Z","title":"Score-based generative modeling through stochastic differential equations.arXiv preprint arXiv:2011.13456, 2020","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-14T02:14:48.628979Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:25.420657Z"},"links":{"cited_paper":"/paper/2011.13456","citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:0737fe2255cefe8d4cbbfa56532f93492be9b3812b813f98348b17a9d25ca528","observation_id":"de0bf15a-4c2d-45d6-aca8-764a6e7b4537","resolution":{"observed_at":"2026-08-07T12:21:25.420657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:25.552279Z","title":"Visual autoregressive modeling: Scalable image generation via next-scale prediction.Advances in neural information processing systems, 37:84839–84865, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-14T02:14:48.628979Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:25.552279Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:3b6df508c33d87b76eec3bc56fe1dd5ed9049121b59806178dbe3969b4f860e9","observation_id":"8c96555e-8b81-48d2-b1b5-3dc956516e39","resolution":{"observed_at":"2026-08-07T12:21:25.552279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:25.629620Z","title":"Diffusion model alignment using direct preference optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-14T02:14:48.628979Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:25.629620Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:4d275f3a1747f80eb8d6e7f3107045f031af88216af93453d6ad1cd0bbd823aa","observation_id":"3c311cfb-3a95-48e4-9241-86dd0325874b","resolution":{"observed_at":"2026-08-07T12:21:25.629620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:28.943179Z","title":"Diffusion models are geometry critics: Single image 3d editing using pre-trained diffusion priors","venue":null,"work_id":"7a7b2ed1-749f-494a-b905-9c467921ba46","year":2024},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-14T02:14:48.628979Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:25.729981Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:16aaadbd6d87abb11d496e5711a1ca6e65d31b970fbc4c8e5cfd58014c78b0e3","observation_id":"f78d723d-8c76-496b-9ed4-ef1477c2fc1b","resolution":{"observed_at":"2026-08-07T12:21:29.062674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18605","last_updated":"2024-12-24T18:58:43Z","snapshot_observed_at":"2026-08-17T14:49:01.554106Z","submitted_at":"2024-12-24T18:58:43Z","title":"Orient Anything: Learning Robust Object Orientation Estimation from Rendering 3D Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18605","snapshot_observed_at":"2026-08-07T12:21:25.818565Z","title":"Orient anything: Learning robust object orientation estimation from rendering 3d models.arXiv preprint arXiv:2412.18605, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-14T02:14:48.628979Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:25.818565Z"},"links":{"cited_paper":"/paper/2412.18605","citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:f6f2f5873e4aa4bce1518bf7a6db3cbdadcebee4d90e30425553643164b06368","observation_id":"73cc1680-f8ff-4b61-b0d8-581ff98c6902","resolution":{"observed_at":"2026-08-07T12:21:25.818565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:25.920486Z","title":"Omniedit: Building image editing generalist models through specialist supervision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-14T02:14:48.628979Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:25.920486Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:689a1e92571a4bb120675aa1d32245157156f28c9fd0487617ccadab14d451b4","observation_id":"eb0590c9-a39a-46d2-b4c8-a14535c1d4f7","resolution":{"observed_at":"2026-08-07T12:21:25.920486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14171","last_updated":"2025-07-02T21:00:36Z","snapshot_observed_at":"2026-08-14T22:29:28.847917Z","submitted_at":"2024-12-18T18:59:54Z","title":"Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14171","snapshot_observed_at":"2026-08-07T12:21:26.035619Z","title":"Thinking in space: How multimodal large language models see, remember, and recall spaces.arXiv preprint arXiv:2412.14171, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-14T02:14:48.628979Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:26.035619Z"},"links":{"cited_paper":"/paper/2412.14171","citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:9ed11966ed1ad375f34d6070b52b87771ecd6397005fd43927527b1a972344fd","observation_id":"139c664c-12f5-400f-8446-4918c0e8a111","resolution":{"observed_at":"2026-08-07T12:21:26.035619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:26.120883Z","title":"Depth anything: Unleashing the power of large-scale unlabeled data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-14T02:14:48.628979Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:26.120883Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:5ad4221e69e26da2b2e6814671f0d3ea043e1d21f8c5ddb09f166ab47c9b00a2","observation_id":"90ca739e-6ff8-4f25-bc48-c6b6614ffa2c","resolution":{"observed_at":"2026-08-07T12:21:26.120883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:26.230334Z","title":"Depth anything v2.Advances in Neural Information Processing Systems, 37:21875–21911, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-14T02:14:48.628979Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:26.230334Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:98ed06aa82be19904fcda395aefb5127f4db60e369195fbaf049401b67dc6781","observation_id":"16264a7c-cc30-41f8-8fbe-8fbe5cc7a133","resolution":{"observed_at":"2026-08-07T12:21:26.230334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:28.758803Z","title":"Image sculpting: Precise object editing with 3d geometry control","venue":null,"work_id":"6e4bc929-4c71-46ca-9c13-dc29e303d978","year":2024},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-14T02:14:48.628979Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:26.342807Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:75a555596f55311f037a1e8b8768680dedfb079e53036380b929ef08b678987d","observation_id":"e12b5993-4dd5-49c4-b548-f8c04ee4552d","resolution":{"observed_at":"2026-08-07T12:21:28.844374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:28.558835Z","title":"Gaze-supported 3d object manipulation in virtual reality","venue":null,"work_id":"a79b37e3-b465-42ca-98bf-0c07aa40ed37","year":2021},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-14T02:14:48.628979Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:26.422478Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:26646bd42fd85f7644d47d02ccf7777dd57737b95e64a63d8cbe523691bb797b","observation_id":"f125b5bf-1a08-411e-a9e2-35acbe2bc18f","resolution":{"observed_at":"2026-08-07T12:21:28.626925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:28.340554Z","title":"Routledge, 2017","venue":null,"work_id":"d43c0dd4-8a3a-4df2-8002-5b50c28a3f76","year":2017},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-14T02:14:48.628979Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:26.528288Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:b3ece94c740dc3d61b4e9dc91a68773642c23b7536ec76f0e4ad9306a36952c0","observation_id":"1653a25b-9850-4c88-b2cc-c46cabde786a","resolution":{"observed_at":"2026-08-07T12:21:28.425306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:26.629052Z","title":"Magicbrush: A manually annotated dataset for instruction-guided image editing.Advances in Neural Information Processing Systems, 36:31428–31449, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-14T02:14:48.628979Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:26.629052Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:2b2458ad4fe1a4a3c181b055f46af933764c9e56279ec99c72c5dc419fa07c6f","observation_id":"f7db2829-6c3e-4c87-a8c0-f72f42a5f8d1","resolution":{"observed_at":"2026-08-07T12:21:26.629052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:26.701661Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-14T02:14:48.628979Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:26.701661Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:5983eb4fbf1140a523cb4651d6bfa3ebbedb0f8f65c02f3fb04e89598a4a23f3","observation_id":"3278abbd-039d-437a-818e-e14884c12d94","resolution":{"observed_at":"2026-08-07T12:21:26.701661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20690","last_updated":"2025-09-23T02:34:36Z","snapshot_observed_at":"2026-08-17T21:14:36.177695Z","submitted_at":"2025-04-29T12:14:47Z","title":"In-Context Edit: Enabling Instructional Image Editing with In-Context Generation in Large Scale Diffusion Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20690","snapshot_observed_at":"2026-08-07T12:21:26.808950Z","title":"In-context edit: Enabling instructional image editing with in-context generation in large scale diffusion transformer.arXiv preprint arXiv:2504.20690, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-14T02:14:48.628979Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:26.808950Z"},"links":{"cited_paper":"/paper/2504.20690","citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:d2d2271112677e3d0c2ec29209dc71ddaaf8e18eddf1c1014e0865f5893291e0","observation_id":"5316e9aa-aa2a-4422-bea9-b113b018d047","resolution":{"observed_at":"2026-08-07T12:21:26.808950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17385","last_updated":"2025-04-17T17:59:27Z","snapshot_observed_at":"2026-08-17T19:38:20.646693Z","submitted_at":"2024-10-22T19:39:15Z","title":"Do Vision-Language Models Represent Space and How? Evaluating Spatial Frame of Reference Under Ambiguities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17385","snapshot_observed_at":"2026-08-07T12:21:26.903958Z","title":"Do vision-language models represent space and how? evaluating spatial frame of reference under ambiguities","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-14T02:14:48.628979Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:26.903958Z"},"links":{"cited_paper":"/paper/2410.17385","citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:1919382e6ac0d5fcdd0bd388c6ce28f75f5c16984941ec0b9d6ea951a0335bf2","observation_id":"c809b1ae-52e3-4d17-9928-ba1826c2861f","resolution":{"observed_at":"2026-08-07T12:21:26.903958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:28.148522Z","title":"Uni-controlnet: All-in-one control to text-to-image diffusion models.Advances in Neural Information Processing Systems, 36:11127–11150, 2023","venue":null,"work_id":"64535767-6ba4-424a-b94f-82bb03d6dba4","year":2023},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-14T02:14:48.628979Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:27.002761Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:186d382067a8f222828aab11c034623a9c12d8fb2059e7dc360d80a1ba0d5d8c","observation_id":"cbf2cd02-1ca4-42bb-a8d5-e0b534a76426","resolution":{"observed_at":"2026-08-07T12:21:28.238220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:21:27.921786Z","title":"right/left view","venue":null,"work_id":"cd8704ad-68e9-4f74-ae2c-d44f02a00743","year":2023},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-14T02:14:48.628979Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:27.112050Z"},"links":{"citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:34b254fdb0c325df583df3e6829c49af122ff413d694f96cc04b9057f2132d17","observation_id":"4b7e23dd-b953-451e-b06c-050557bf65be","resolution":{"observed_at":"2026-08-07T12:21:28.034247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T02:14:48.628979Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation"},"reference_resolution":{"displayed":69,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":49,"verified_exact":1,"verified_fuzzy":19},"total_outbound_references":69},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 69 of 69 outbound references and 4 inbound Pith citation observations for arXiv:2505.24870."}