{"as_of":"2026-08-14T07:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4d33d027d96ee285188b1e793bbcf44525e142a4e3afee8653ede38148a3a12b","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:29:21.502877Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:15:37.003251Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T00:15:41.320900Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.18730","last_updated":"2025-05-24T14:56:09Z","snapshot_observed_at":"2026-08-07T17:06:29.055596Z","submitted_at":"2025-05-24T14:56:09Z","title":"Align Beyond Prompts: Evaluating World Knowledge Alignment in Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":"2505.18730","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.18730","snapshot_observed_at":"2026-08-07T00:15:41.320900Z","title":"Align Beyond Prompts: Evaluating World Knowledge Alignment in Text-to-Image Generation","venue":"cs.CV","work_id":"71aeb9d3-821b-4452-a5a3-3a4421b74062","year":2025},"citing_paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","snapshot_observed_at":"2026-08-14T00:44:10.664373Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:37.003251Z"},"links":{"cited_paper":"/paper/2505.18730","citing_paper":"/paper/2608.04436"},"observation_digest":"sha256:80b24494ae79644eb97c5f12803e4c300ff6f3c259d88a4ac8f0bd1bd26e37a3","observation_id":"f4cced5a-a747-4f11-ab60-922e101f0195","resolution":{"observed_at":"2026-08-07T00:15:41.386031Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.18730/citation-record","integrity":"/paper/2505.18730/integrity","json":"/paper/2505.18730/citation-record.json","paper":"/paper/2505.18730"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:13.694400Z","title":"Tallyqa: Answering complex counting questions","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.18730","last_updated":"2025-05-24T14:56:09Z","snapshot_observed_at":"2026-08-07T17:06:29.055596Z","submitted_at":"2025-05-24T14:56:09Z","title":"Align Beyond Prompts: Evaluating World Knowledge Alignment in Text-to-Image Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:13.694400Z"},"links":{"citing_paper":"/paper/2505.18730"},"observation_digest":"sha256:8939d6023d8cc5307dae1a73ce5b269140ae5ff32671f841f31c6cc06d45c40c","observation_id":"bb155788-5860-4057-8397-0021a4ce904e","resolution":{"observed_at":"2026-08-07T14:29:13.694400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:26.972488Z","title":"Improving image generation with better captions","venue":null,"work_id":"fc749599-3eff-49ae-a6fb-4c1240131d4e","year":2023},"citing_paper":{"arxiv_id":"2505.18730","last_updated":"2025-05-24T14:56:09Z","snapshot_observed_at":"2026-08-07T17:06:29.055596Z","submitted_at":"2025-05-24T14:56:09Z","title":"Align Beyond Prompts: Evaluating World Knowledge Alignment in Text-to-Image Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:13.847917Z"},"links":{"citing_paper":"/paper/2505.18730"},"observation_digest":"sha256:b080e6a0bcfe3cd6f760919c8cea75d18457e7a7ae4e9ddb732e8899650f5614","observation_id":"b9288481-74b3-4e63-8eb6-e7786d218de3","resolution":{"observed_at":"2026-08-07T14:29:27.077673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07558","last_updated":"2023-05-12T15:34:20Z","snapshot_observed_at":"2026-08-13T11:43:40.711012Z","submitted_at":"2023-05-12T15:34:20Z","title":"Measuring Progress in Fine-grained Vision-and-Language Understanding","version":1},"cited_work":{"arxiv_id":"2305.07558","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.07558","snapshot_observed_at":"2026-08-07T14:29:22.447344Z","title":"Measuring Progress in Fine-grained Vision-and-Language Understanding","venue":"cs.CL","work_id":"bb17f82a-4d98-4693-8e9f-9e3af97d3fb3","year":2023},"citing_paper":{"arxiv_id":"2505.18730","last_updated":"2025-05-24T14:56:09Z","snapshot_observed_at":"2026-08-07T17:06:29.055596Z","submitted_at":"2025-05-24T14:56:09Z","title":"Align Beyond Prompts: Evaluating World Knowledge Alignment in Text-to-Image Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:13.981587Z"},"links":{"cited_paper":"/paper/2305.07558","citing_paper":"/paper/2505.18730"},"observation_digest":"sha256:e189cd7cb4e1f131bf3d983fc6ad7fc32f6a5eda71d526a995fa93c0552f2d79","observation_id":"b22070d4-e572-4756-8565-068c657e214f","resolution":{"observed_at":"2026-08-07T14:29:22.567556Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.18235","last_updated":"2024-03-13T21:58:59Z","snapshot_observed_at":"2026-08-13T05:38:57.804728Z","submitted_at":"2023-10-27T16:20:10Z","title":"Davidsonian Scene Graph: Improving Reliability in Fine-grained Evaluation for Text-to-Image Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.18235","snapshot_observed_at":"2026-08-07T14:29:14.112716Z","title":"Davidsonian scene graph: Improving reliability in fine-grained evaluation for text-to-image generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18730","last_updated":"2025-05-24T14:56:09Z","snapshot_observed_at":"2026-08-07T17:06:29.055596Z","submitted_at":"2025-05-24T14:56:09Z","title":"Align Beyond Prompts: Evaluating World Knowledge Alignment in Text-to-Image Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:14.112716Z"},"links":{"cited_paper":"/paper/2310.18235","citing_paper":"/paper/2505.18730"},"observation_digest":"sha256:46b6841815ac066ebe926c6b7934ea8208e634bc74822e24296be5bf5d98b3eb","observation_id":"26f778c1-79de-4b56-be96-4f45fd88478d","resolution":{"observed_at":"2026-08-07T14:29:14.112716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2202.04895","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:22.272710Z","title":"Diffusion bridges vector quantized variational autoencoders","venue":null,"work_id":"ffff5615-091b-49c6-bac7-886fee340836","year":2022},"citing_paper":{"arxiv_id":"2505.18730","last_updated":"2025-05-24T14:56:09Z","snapshot_observed_at":"2026-08-07T17:06:29.055596Z","submitted_at":"2025-05-24T14:56:09Z","title":"Align Beyond Prompts: Evaluating World Knowledge Alignment in Text-to-Image Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:14.286282Z"},"links":{"citing_paper":"/paper/2505.18730"},"observation_digest":"sha256:be357e47b0f1d19b89130e6147fae7a0e093603c5d6a5163b22a49f971a47cdf","observation_id":"983e1a34-ec16-4d73-985d-19c899a95292","resolution":{"observed_at":"2026-08-07T14:29:22.316111Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:14.417588Z","title":"Cogview: Mastering text-to-image generation via transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.18730","last_updated":"2025-05-24T14:56:09Z","snapshot_observed_at":"2026-08-07T17:06:29.055596Z","submitted_at":"2025-05-24T14:56:09Z","title":"Align Beyond Prompts: Evaluating World Knowledge Alignment in Text-to-Image Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:14.417588Z"},"links":{"citing_paper":"/paper/2505.18730"},"observation_digest":"sha256:ab0ef89ffb512a7fe72cacd19577a4b30dab238174b4d0cb3e41c374ddc28091","observation_id":"5ee96bd6-5812-4111-9840-580c0171524a","resolution":{"observed_at":"2026-08-07T14:29:14.417588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:14.601166Z","title":"Scaling rectified flow transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18730","last_updated":"2025-05-24T14:56:09Z","snapshot_observed_at":"2026-08-07T17:06:29.055596Z","submitted_at":"2025-05-24T14:56:09Z","title":"Align Beyond Prompts: Evaluating World Knowledge Alignment in Text-to-Image Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:14.601166Z"},"links":{"citing_paper":"/paper/2505.18730"},"observation_digest":"sha256:790557052ba1138771739433577c5f9f58734035c33ffb799ebf7bf978a71752","observation_id":"dedadfc0-9772-4ce7-a207-fa949c6364cb","resolution":{"observed_at":"2026-08-07T14:29:14.601166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07546","last_updated":"2024-08-12T19:33:52Z","snapshot_observed_at":"2026-08-12T23:45:15.516382Z","submitted_at":"2024-06-11T17:59:48Z","title":"Commonsense-T2I Challenge: Can Text-to-Image Generation Models Understand Commonsense?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07546","snapshot_observed_at":"2026-08-07T14:29:14.789184Z","title":"Commonsense-t2i challenge: Can text-to-image generation models understand commonsense? arXiv preprint arXiv:2406.07546, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18730","last_updated":"2025-05-24T14:56:09Z","snapshot_observed_at":"2026-08-07T17:06:29.055596Z","submitted_at":"2025-05-24T14:56:09Z","title":"Align Beyond Prompts: Evaluating World Knowledge Alignment in Text-to-Image Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:14.789184Z"},"links":{"cited_paper":"/paper/2406.07546","citing_paper":"/paper/2505.18730"},"observation_digest":"sha256:2dea66f8e21285d93f5950e7006cbb71689d58cbe4ed0773900f1a80b52f69c0","observation_id":"cc46d3a9-9e75-4f0f-83e2-6b198eacd0d1","resolution":{"observed_at":"2026-08-07T14:29:14.789184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10015","last_updated":"2023-10-27T17:24:04Z","snapshot_observed_at":"2026-08-13T20:44:10.891975Z","submitted_at":"2022-12-20T06:03:51Z","title":"Benchmarking Spatial Relationships in Text-to-Image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10015","snapshot_observed_at":"2026-08-07T14:29:14.923026Z","title":"Benchmarking spatial relationships in text-to-image generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18730","last_updated":"2025-05-24T14:56:09Z","snapshot_observed_at":"2026-08-07T17:06:29.055596Z","submitted_at":"2025-05-24T14:56:09Z","title":"Align Beyond Prompts: Evaluating World Knowledge Alignment in Text-to-Image Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:14.923026Z"},"links":{"cited_paper":"/paper/2212.10015","citing_paper":"/paper/2505.18730"},"observation_digest":"sha256:d4f694bd7c5867c720a3c171def7cec11dc3195b58e22337f0d08ce581f15352","observation_id":"c9468441-2afa-4be0-b5c9-cf182aa22214","resolution":{"observed_at":"2026-08-07T14:29:14.923026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:26.703607Z","title":"Generative adversarial networks","venue":null,"work_id":"ae37b3ff-134c-4e97-ad39-1a3885b9bee6","year":2020},"citing_paper":{"arxiv_id":"2505.18730","last_updated":"2025-05-24T14:56:09Z","snapshot_observed_at":"2026-08-07T17:06:29.055596Z","submitted_at":"2025-05-24T14:56:09Z","title":"Align Beyond Prompts: Evaluating World Knowledge Alignment in Text-to-Image Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:15.109768Z"},"links":{"citing_paper":"/paper/2505.18730"},"observation_digest":"sha256:246d7963587ec9a842f770b2d59d0959100567b98958480290915077af8957bf","observation_id":"59ccdda0-f430-4c38-9009-11a1a97e28b7","resolution":{"observed_at":"2026-08-07T14:29:26.796147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-07T14:29:15.301188Z","title":"Clipscore: A reference-free evaluation metric for image captioning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.18730","last_updated":"2025-05-24T14:56:09Z","snapshot_observed_at":"2026-08-07T17:06:29.055596Z","submitted_at":"2025-05-24T14:56:09Z","title":"Align Beyond Prompts: Evaluating World Knowledge Alignment in Text-to-Image Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:15.301188Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2505.18730"},"observation_digest":"sha256:aa48c4cc393c4fe14ac19defddfacc68deae48d08460429fcce40c171555a3c9","observation_id":"147352c5-6109-4beb-b5ee-c404ccb4391a","resolution":{"observed_at":"2026-08-07T14:29:15.301188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:15.489580Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilibrium.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.18730","last_updated":"2025-05-24T14:56:09Z","snapshot_observed_at":"2026-08-07T17:06:29.055596Z","submitted_at":"2025-05-24T14:56:09Z","title":"Align Beyond Prompts: Evaluating World Knowledge Alignment in Text-to-Image Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:15.489580Z"},"links":{"citing_paper":"/paper/2505.18730"},"observation_digest":"sha256:c165c40093f0b2e7f0096f2b9295ad7b8adb65c0bc023f63c85088e306039c82","observation_id":"43fa08c3-38d4-4b2b-9a3c-32c0d08ae7e0","resolution":{"observed_at":"2026-08-07T14:29:15.489580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:15.681993Z","title":"Tifa: Accurate and interpretable text-to-image faithfulness evaluation with question answering","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18730","last_updated":"2025-05-24T14:56:09Z","snapshot_observed_at":"2026-08-07T17:06:29.055596Z","submitted_at":"2025-05-24T14:56:09Z","title":"Align Beyond Prompts: Evaluating World Knowledge Alignment in Text-to-Image Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:15.681993Z"},"links":{"citing_paper":"/paper/2505.18730"},"observation_digest":"sha256:1c82c92e84060dc02df55907c4c5dad05a3ed91a1bbe6397f10215875944c020","observation_id":"09441fd1-98fd-44c3-bd7b-73ffe3d9233b","resolution":{"observed_at":"2026-08-07T14:29:15.681993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:15.867570Z","title":"T2i-compbench: A comprehensive benchmark for open-world compositional text-to-image generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18730","last_updated":"2025-05-24T14:56:09Z","snapshot_observed_at":"2026-08-07T17:06:29.055596Z","submitted_at":"2025-05-24T14:56:09Z","title":"Align Beyond Prompts: Evaluating World Knowledge Alignment in Text-to-Image Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:15.867570Z"},"links":{"citing_paper":"/paper/2505.18730"},"observation_digest":"sha256:889ddcab85371cb17c7b0ebddfab204d8836a01fc144bc43c59b5c347f85bd7c","observation_id":"931fe707-d246-42bf-9148-193bf9ab403e","resolution":{"observed_at":"2026-08-07T14:29:15.867570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:26.455610Z","title":"Evaluating numerical reasoning in text-to-image models","venue":null,"work_id":"f9c05daa-0925-45c6-a463-0682dc77cc87","year":2024},"citing_paper":{"arxiv_id":"2505.18730","last_updated":"2025-05-24T14:56:09Z","snapshot_observed_at":"2026-08-07T17:06:29.055596Z","submitted_at":"2025-05-24T14:56:09Z","title":"Align Beyond Prompts: Evaluating World Knowledge Alignment in Text-to-Image Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:15.998258Z"},"links":{"citing_paper":"/paper/2505.18730"},"observation_digest":"sha256:f5326895b79ae81456f5575c37d0c5086ce9b7429c16d91b389365c0f5180ff1","observation_id":"44eaefcc-fe82-4fde-9909-4827c573cea9","resolution":{"observed_at":"2026-08-07T14:29:26.572628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2022.00246","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:21.928448Z","title":"Diffusionclip: Text-guided diffusion models for robust image manipulation","venue":null,"work_id":"766dbad9-c4c3-4780-a992-fbeba5d2ec24","year":2022},"citing_paper":{"arxiv_id":"2505.18730","last_updated":"2025-05-24T14:56:09Z","snapshot_observed_at":"2026-08-07T17:06:29.055596Z","submitted_at":"2025-05-24T14:56:09Z","title":"Align Beyond Prompts: Evaluating World Knowledge Alignment in Text-to-Image Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:16.164128Z"},"links":{"citing_paper":"/paper/2505.18730"},"observation_digest":"sha256:e035b274bdfaaa862fc3483fbf6d5164edce11dc0f1ccae6c7bc4ea88f3aa54c","observation_id":"1988dbe4-d4fd-455a-bd7e-c2f5b4bcc060","resolution":{"observed_at":"2026-08-07T14:29:22.049661Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:16.279484Z","title":"Pick-a- pic: An open dataset of user preferences for text-to-image generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18730","last_updated":"2025-05-24T14:56:09Z","snapshot_observed_at":"2026-08-07T17:06:29.055596Z","submitted_at":"2025-05-24T14:56:09Z","title":"Align Beyond Prompts: Evaluating World Knowledge Alignment in Text-to-Image Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:16.279484Z"},"links":{"citing_paper":"/paper/2505.18730"},"observation_digest":"sha256:8e49768c878e549215eaba11b2de84537102b4e43a3ab15ed90294dd586f8144","observation_id":"f8548f64-4ed7-47d4-8d13-c88d1a28bc68","resolution":{"observed_at":"2026-08-07T14:29:16.279484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14867","last_updated":"2024-06-03T16:59:20Z","snapshot_observed_at":"2026-08-13T04:55:05.773072Z","submitted_at":"2023-12-22T17:45:19Z","title":"VIEScore: Towards Explainable Metrics for Conditional Image Synthesis Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14867","snapshot_observed_at":"2026-08-07T14:29:16.408545Z","title":"Viescore: Towards explainable metrics for conditional image synthesis evaluation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18730","last_updated":"2025-05-24T14:56:09Z","snapshot_observed_at":"2026-08-07T17:06:29.055596Z","submitted_at":"2025-05-24T14:56:09Z","title":"Align Beyond Prompts: Evaluating World Knowledge Alignment in Text-to-Image Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:16.408545Z"},"links":{"cited_paper":"/paper/2312.14867","citing_paper":"/paper/2505.18730"},"observation_digest":"sha256:bb45a0a9bbe58a446986b3a5aafac588814da28326f3d5060da69c8870482211","observation_id":"1e5abc39-9021-49d6-8b63-15ce95ed4fee","resolution":{"observed_at":"2026-08-07T14:29:16.408545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:16.572717Z","title":"Multi-concept customization of text-to-image diffusion","venue":null,"work_id":null,"year":1931},"citing_paper":{"arxiv_id":"2505.18730","last_updated":"2025-05-24T14:56:09Z","snapshot_observed_at":"2026-08-07T17:06:29.055596Z","submitted_at":"2025-05-24T14:56:09Z","title":"Align Beyond Prompts: Evaluating World Knowledge Alignment in Text-to-Image Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:16.572717Z"},"links":{"citing_paper":"/paper/2505.18730"},"observation_digest":"sha256:1c48aee4b44054b2f05083a8d1d2528fab9a9bf2f3e126e6b227b2a4abbe91ee","observation_id":"fd29f28e-7ba9-4377-881e-7345fd63229c","resolution":{"observed_at":"2026-08-07T14:29:16.572717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:26.226041Z","title":"Holistic evaluation of text-to-image models","venue":null,"work_id":"d755ac42-ea0c-40b3-93a3-9ba155d39665","year":2023},"citing_paper":{"arxiv_id":"2505.18730","last_updated":"2025-05-24T14:56:09Z","snapshot_observed_at":"2026-08-07T17:06:29.055596Z","submitted_at":"2025-05-24T14:56:09Z","title":"Align Beyond Prompts: Evaluating World Knowledge Alignment in Text-to-Image Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:16.687718Z"},"links":{"citing_paper":"/paper/2505.18730"},"observation_digest":"sha256:f1aa5397824d133f8cc7297b4adc312c5be5e6bde54b192b2216c5331b44f8c6","observation_id":"49365c10-8081-4ec1-b56c-12845b9c04e1","resolution":{"observed_at":"2026-08-07T14:29:26.317345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13743","last_updated":"2024-11-03T20:22:32Z","snapshot_observed_at":"2026-08-12T23:38:59.439688Z","submitted_at":"2024-06-19T18:00:07Z","title":"GenAI-Bench: Evaluating and Improving Compositional Text-to-Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.13743","snapshot_observed_at":"2026-08-07T14:29:16.838722Z","title":"Genai-bench: Evaluating and improving compositional text-to-visual generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18730","last_updated":"2025-05-24T14:56:09Z","snapshot_observed_at":"2026-08-07T17:06:29.055596Z","submitted_at":"2025-05-24T14:56:09Z","title":"Align Beyond Prompts: Evaluating World Knowledge Alignment in Text-to-Image Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:16.838722Z"},"links":{"cited_paper":"/paper/2406.13743","citing_paper":"/paper/2505.18730"},"observation_digest":"sha256:91f88e0c99908a5e0bb11557ede25599fc3997185cf18d2bdacd3c0c1b1ca66e","observation_id":"1bd714eb-f125-4c00-9927-2646a537b6fc","resolution":{"observed_at":"2026-08-07T14:29:16.838722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:25.959250Z","title":"Evaluating and improving compositional text-to-visual generation","venue":null,"work_id":"51a8b0cd-35a0-4289-b239-14212e0ba553","year":2024},"citing_paper":{"arxiv_id":"2505.18730","last_updated":"2025-05-24T14:56:09Z","snapshot_observed_at":"2026-08-07T17:06:29.055596Z","submitted_at":"2025-05-24T14:56:09Z","title":"Align Beyond Prompts: Evaluating World Knowledge Alignment in Text-to-Image Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:16.980088Z"},"links":{"citing_paper":"/paper/2505.18730"},"observation_digest":"sha256:82c8017921428d4fa0c8c86190d41b406299b6b1d7890e746edd6e3e7798bcdd","observation_id":"b4ba232f-7829-4ec7-94a6-3846824810e9","resolution":{"observed_at":"2026-08-07T14:29:26.109268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:17.166743Z","title":"Blip-diffusion: Pre-trained subject representation for controllable text-to-image generation and editing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18730","last_updated":"2025-05-24T14:56:09Z","snapshot_observed_at":"2026-08-07T17:06:29.055596Z","submitted_at":"2025-05-24T14:56:09Z","title":"Align Beyond Prompts: Evaluating World Knowledge Alignment in Text-to-Image Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:17.166743Z"},"links":{"citing_paper":"/paper/2505.18730"},"observation_digest":"sha256:560a68ca6e99427a34d768a29c4698e5c3b4e9894368d91c625dc8efe5584530","observation_id":"6dc4ac3c-753d-4ec2-ae99-68fa65054518","resolution":{"observed_at":"2026-08-07T14:29:17.166743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:17.284669Z","title":"Science-t2i: Addressing scientific illusions in image synthesis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18730","last_updated":"2025-05-24T14:56:09Z","snapshot_observed_at":"2026-08-07T17:06:29.055596Z","submitted_at":"2025-05-24T14:56:09Z","title":"Align Beyond Prompts: Evaluating World Knowledge Alignment in Text-to-Image Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:17.284669Z"},"links":{"citing_paper":"/paper/2505.18730"},"observation_digest":"sha256:d175473c7e7b8b91a8a0c60325f05afadfb8964940e18665fbd75639c33dcb9f","observation_id":"798f96f2-cacf-46a2-943a-da52e98e7db8","resolution":{"observed_at":"2026-08-07T14:29:17.284669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:25.715725Z","title":"Rich human feedback for text-to-image generation","venue":null,"work_id":"5eede906-a0f4-4507-b984-6c9d145bbe63","year":2024},"citing_paper":{"arxiv_id":"2505.18730","last_updated":"2025-05-24T14:56:09Z","snapshot_observed_at":"2026-08-07T17:06:29.055596Z","submitted_at":"2025-05-24T14:56:09Z","title":"Align Beyond Prompts: Evaluating World Knowledge Alignment in Text-to-Image Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:17.436476Z"},"links":{"citing_paper":"/paper/2505.18730"},"observation_digest":"sha256:54fa0e6ad52d2fe4efaa4e5c2b062b26598ad7d6b0adcdc77346bc8569614d39","observation_id":"9f06d282-874c-4a0d-b22c-04d94b4a4482","resolution":{"observed_at":"2026-08-07T14:29:25.806499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:17.595148Z","title":"Evaluating text-to-visual generation with image-to-text generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18730","last_updated":"2025-05-24T14:56:09Z","snapshot_observed_at":"2026-08-07T17:06:29.055596Z","submitted_at":"2025-05-24T14:56:09Z","title":"Align Beyond Prompts: Evaluating World Knowledge Alignment in Text-to-Image Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:17.595148Z"},"links":{"citing_paper":"/paper/2505.18730"},"observation_digest":"sha256:f32ed44440c903d42281499c78159783d54e92c725b63339c12bddc22e6ee731","observation_id":"bfdddb92-6456-4b80-84e6-9c188efbb1ea","resolution":{"observed_at":"2026-08-07T14:29:17.595148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:25.367741Z","title":"Llmscore: Unveiling the power of large language models in text-to-image synthesis evaluation","venue":null,"work_id":"639dc43f-cd83-419b-9c9d-1d40d062324d","year":2023},"citing_paper":{"arxiv_id":"2505.18730","last_updated":"2025-05-24T14:56:09Z","snapshot_observed_at":"2026-08-07T17:06:29.055596Z","submitted_at":"2025-05-24T14:56:09Z","title":"Align Beyond Prompts: Evaluating World Knowledge Alignment in Text-to-Image Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:17.729078Z"},"links":{"citing_paper":"/paper/2505.18730"},"observation_digest":"sha256:60865c48826a495ea99bdef685d6828e8d5fe6811518f0421bc663cafab62172","observation_id":"481a1896-9b42-41f6-a953-80a733cd2052","resolution":{"observed_at":"2026-08-07T14:29:25.552190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09732","last_updated":"2025-01-16T18:30:37Z","snapshot_observed_at":"2026-07-06T20:22:04.328179Z","submitted_at":"2025-01-16T18:30:37Z","title":"Inference-Time Scaling for Diffusion Models beyond Scaling Denoising Steps","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09732","snapshot_observed_at":"2026-08-07T14:29:17.887379Z","title":"Inference-time scaling for diffusion models beyond scaling denoising steps","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18730","last_updated":"2025-05-24T14:56:09Z","snapshot_observed_at":"2026-08-07T17:06:29.055596Z","submitted_at":"2025-05-24T14:56:09Z","title":"Align Beyond Prompts: Evaluating World Knowledge Alignment in Text-to-Image Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:17.887379Z"},"links":{"cited_paper":"/paper/2501.09732","citing_paper":"/paper/2505.18730"},"observation_digest":"sha256:de492f31d334da8c679c155ed2e8ce415c06d84a311f6369f1f152ac04b127ae","observation_id":"68867e7c-2fb7-40e9-a590-99e9727bb743","resolution":{"observed_at":"2026-08-07T14:29:17.887379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11802","last_updated":"2024-09-21T06:53:58Z","snapshot_observed_at":"2026-08-12T23:40:48.492321Z","submitted_at":"2024-06-17T17:49:01Z","title":"PhyBench: A Physical Commonsense Benchmark for Evaluating Text-to-Image Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11802","snapshot_observed_at":"2026-08-07T14:29:18.079146Z","title":"Phybench: A physical commonsense benchmark for evaluating text-to-image models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18730","last_updated":"2025-05-24T14:56:09Z","snapshot_observed_at":"2026-08-07T17:06:29.055596Z","submitted_at":"2025-05-24T14:56:09Z","title":"Align Beyond Prompts: Evaluating World Knowledge Alignment in Text-to-Image Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:18.079146Z"},"links":{"cited_paper":"/paper/2406.11802","citing_paper":"/paper/2505.18730"},"observation_digest":"sha256:b93ed5a60aa7500744db11ed64725e5267eb8073d5c886d1d39a8ea242dbd0e0","observation_id":"d461ebed-ec12-46be-b344-a95a16f4f7af","resolution":{"observed_at":"2026-08-07T14:29:18.079146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:25.033048Z","title":"Midjourney version 6, 2024","venue":null,"work_id":"e8cb0587-92ef-4223-9f7d-d67a07b11d34","year":2024},"citing_paper":{"arxiv_id":"2505.18730","last_updated":"2025-05-24T14:56:09Z","snapshot_observed_at":"2026-08-07T17:06:29.055596Z","submitted_at":"2025-05-24T14:56:09Z","title":"Align Beyond Prompts: Evaluating World Knowledge Alignment in Text-to-Image Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:18.238625Z"},"links":{"citing_paper":"/paper/2505.18730"},"observation_digest":"sha256:83fc818c8806461998e7d1a1bc5915445487eee4142367ff780cde2f95c62380","observation_id":"3964ce9f-9f17-4662-ace8-aa6ea3b9e62b","resolution":{"observed_at":"2026-08-07T14:29:25.220668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:24.646205Z","title":"Addendum to gpt-4o system card: Native image generation, 2025","venue":null,"work_id":"a4cf67c2-fef4-4f2d-a094-8957d6c71848","year":2025},"citing_paper":{"arxiv_id":"2505.18730","last_updated":"2025-05-24T14:56:09Z","snapshot_observed_at":"2026-08-07T17:06:29.055596Z","submitted_at":"2025-05-24T14:56:09Z","title":"Align Beyond Prompts: Evaluating World Knowledge Alignment in Text-to-Image Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:18.374045Z"},"links":{"citing_paper":"/paper/2505.18730"},"observation_digest":"sha256:b2d3522e7ec1886883787ba62759a4cfbcab3e05901fb27501d802b7c2f9121d","observation_id":"eae11b18-8e14-493c-8ac3-d3666dbe26ce","resolution":{"observed_at":"2026-08-07T14:29:24.828748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:24.309551Z","title":"Toward verifiable and reproducible human evaluation for text-to-image generation","venue":null,"work_id":"620ee394-ca1b-49f0-bddc-e0b208f09215","year":2023},"citing_paper":{"arxiv_id":"2505.18730","last_updated":"2025-05-24T14:56:09Z","snapshot_observed_at":"2026-08-07T17:06:29.055596Z","submitted_at":"2025-05-24T14:56:09Z","title":"Align Beyond Prompts: Evaluating World Knowledge Alignment in Text-to-Image Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:18.523882Z"},"links":{"citing_paper":"/paper/2505.18730"},"observation_digest":"sha256:9225062dfa327e659abc98068a8304cc51fa7cbd05951731d0c9bc0615a7f881","observation_id":"b1fa7751-f450-4eb1-9bf9-585305419fb4","resolution":{"observed_at":"2026-08-07T14:29:24.454859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:23.983057Z","title":"Teaching clip to count to ten","venue":null,"work_id":"bb832e39-bc90-48e3-bf96-aa61ce41df0b","year":2023},"citing_paper":{"arxiv_id":"2505.18730","last_updated":"2025-05-24T14:56:09Z","snapshot_observed_at":"2026-08-07T17:06:29.055596Z","submitted_at":"2025-05-24T14:56:09Z","title":"Align Beyond Prompts: Evaluating World Knowledge Alignment in Text-to-Image Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:18.652281Z"},"links":{"citing_paper":"/paper/2505.18730"},"observation_digest":"sha256:fc3e9a024ee94f264d6333f500e8434a6012f875fe500b4e7353063ecd5e3fdb","observation_id":"37a47874-8eea-404d-a9a3-198a3b995e48","resolution":{"observed_at":"2026-08-07T14:29:24.122426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-07T14:29:18.821920Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18730","last_updated":"2025-05-24T14:56:09Z","snapshot_observed_at":"2026-08-07T17:06:29.055596Z","submitted_at":"2025-05-24T14:56:09Z","title":"Align Beyond Prompts: Evaluating World Knowledge Alignment in Text-to-Image Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:18.821920Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2505.18730"},"observation_digest":"sha256:5f2be90da5de6e23d79d47312f163a9f03b444601a0f52f0615d9b58aebb2213","observation_id":"c9382c27-0787-40e4-a11d-9b9e6779c11c","resolution":{"observed_at":"2026-08-07T14:29:18.821920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:18.979999Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.18730","last_updated":"2025-05-24T14:56:09Z","snapshot_observed_at":"2026-08-07T17:06:29.055596Z","submitted_at":"2025-05-24T14:56:09Z","title":"Align Beyond Prompts: Evaluating World Knowledge Alignment in Text-to-Image Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:18.979999Z"},"links":{"citing_paper":"/paper/2505.18730"},"observation_digest":"sha256:7dcea4d8d6ad5420a0f85e689e058feec547b8cb263603c1f4131f6d4fe931ea","observation_id":"7fb2f27d-6d47-4896-9d19-36e92326f8d1","resolution":{"observed_at":"2026-08-07T14:29:18.979999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:19.152449Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18730","last_updated":"2025-05-24T14:56:09Z","snapshot_observed_at":"2026-08-07T17:06:29.055596Z","submitted_at":"2025-05-24T14:56:09Z","title":"Align Beyond Prompts: Evaluating World Knowledge Alignment in Text-to-Image Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:19.152449Z"},"links":{"citing_paper":"/paper/2505.18730"},"observation_digest":"sha256:4d45342a5dc4281059ad4b4f5971b232c9aab35f2b42fa53618a431865a30575","observation_id":"d76aa6c1-2180-4ba8-a0ad-e45426ed8678","resolution":{"observed_at":"2026-08-07T14:29:19.152449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:23.636014Z","title":"Dream- booth: Fine tuning text-to-image diffusion models for subject-driven generation","venue":null,"work_id":"f3a69b25-275c-46a7-9e2d-bebd8c269c6f","year":2023},"citing_paper":{"arxiv_id":"2505.18730","last_updated":"2025-05-24T14:56:09Z","snapshot_observed_at":"2026-08-07T17:06:29.055596Z","submitted_at":"2025-05-24T14:56:09Z","title":"Align Beyond Prompts: Evaluating World Knowledge Alignment in Text-to-Image Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:19.316019Z"},"links":{"citing_paper":"/paper/2505.18730"},"observation_digest":"sha256:4fb58c61a80900362de0ac9f47dc596b9d8e09b00b13fd594bebc6633251d1bc","observation_id":"f54582fd-e8b0-48f6-9018-350a703b5364","resolution":{"observed_at":"2026-08-07T14:29:23.828286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:19.487869Z","title":"Photorealistic text-to- image diffusion models with deep language understanding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18730","last_updated":"2025-05-24T14:56:09Z","snapshot_observed_at":"2026-08-07T17:06:29.055596Z","submitted_at":"2025-05-24T14:56:09Z","title":"Align Beyond Prompts: Evaluating World Knowledge Alignment in Text-to-Image Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:19.487869Z"},"links":{"citing_paper":"/paper/2505.18730"},"observation_digest":"sha256:73b63a9c3a05a29ceeb4d69376f48e536f4458ad2aa53c9479798df0fee00f19","observation_id":"95d758fe-e73d-41a6-861f-0b67054236a1","resolution":{"observed_at":"2026-08-07T14:29:19.487869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:19.673272Z","title":"Improved techniques for training gans","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.18730","last_updated":"2025-05-24T14:56:09Z","snapshot_observed_at":"2026-08-07T17:06:29.055596Z","submitted_at":"2025-05-24T14:56:09Z","title":"Align Beyond Prompts: Evaluating World Knowledge Alignment in Text-to-Image Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:19.673272Z"},"links":{"citing_paper":"/paper/2505.18730"},"observation_digest":"sha256:3e543a29da5fbe83c4b3c99c798ac02577f892f05c7332e52cc203980986f716","observation_id":"97a2557f-3e34-439b-b6c5-11430e8c3237","resolution":{"observed_at":"2026-08-07T14:29:19.673272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:23.306754Z","title":"Enhancing image generation by fusing auto encoder & transformative generation approach","venue":null,"work_id":"466cd47f-3e16-4b02-8bcf-1af4118d6002","year":2024},"citing_paper":{"arxiv_id":"2505.18730","last_updated":"2025-05-24T14:56:09Z","snapshot_observed_at":"2026-08-07T17:06:29.055596Z","submitted_at":"2025-05-24T14:56:09Z","title":"Align Beyond Prompts: Evaluating World Knowledge Alignment in Text-to-Image Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:19.806945Z"},"links":{"citing_paper":"/paper/2505.18730"},"observation_digest":"sha256:f5d0e44e3c98e3026bbc21810961ee69934dfc5f07be3cdd2cdd468a2182f772","observation_id":"fe780c4f-4ce7-4489-93e9-279dcbd7eb5a","resolution":{"observed_at":"2026-08-07T14:29:23.446628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:19.937516Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18730","last_updated":"2025-05-24T14:56:09Z","snapshot_observed_at":"2026-08-07T17:06:29.055596Z","submitted_at":"2025-05-24T14:56:09Z","title":"Align Beyond Prompts: Evaluating World Knowledge Alignment in Text-to-Image Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:19.937516Z"},"links":{"citing_paper":"/paper/2505.18730"},"observation_digest":"sha256:6ac94979ef768318c88be65054cd5a9db6bf3aaeea8f5b9bd3275717ae331f4a","observation_id":"ab8faaa4-7d4b-4eca-b572-142f7c2330a8","resolution":{"observed_at":"2026-08-07T14:29:19.937516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:23.064759Z","title":"Conceptnet 5.5: An open multilingual graph of general knowledge","venue":null,"work_id":"be59cd8b-654d-46d6-b2ba-1d5214d8eb27","year":2017},"citing_paper":{"arxiv_id":"2505.18730","last_updated":"2025-05-24T14:56:09Z","snapshot_observed_at":"2026-08-07T17:06:29.055596Z","submitted_at":"2025-05-24T14:56:09Z","title":"Align Beyond Prompts: Evaluating World Knowledge Alignment in Text-to-Image Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:20.089494Z"},"links":{"citing_paper":"/paper/2505.18730"},"observation_digest":"sha256:c70e07ea954e8e500d2e001e43d1c573cff3928798edc270909b81e5c8958c2a","observation_id":"e47f5798-5c80-4869-97a2-f217263df9e6","resolution":{"observed_at":"2026-08-07T14:29:23.159746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T14:29:20.226654Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18730","last_updated":"2025-05-24T14:56:09Z","snapshot_observed_at":"2026-08-07T17:06:29.055596Z","submitted_at":"2025-05-24T14:56:09Z","title":"Align Beyond Prompts: Evaluating World Knowledge Alignment in Text-to-Image Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:20.226654Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2505.18730"},"observation_digest":"sha256:8c32e3193f41c141384c747b5134c30fc931ebc60a41a732ec0848bcc5efe244","observation_id":"d68228e6-44a5-494f-af9d-d2e7fcc388e7","resolution":{"observed_at":"2026-08-07T14:29:20.226654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16820","last_updated":"2025-03-17T15:53:14Z","snapshot_observed_at":"2026-08-13T00:22:03.823167Z","submitted_at":"2024-04-25T17:58:43Z","title":"Revisiting Text-to-Image Evaluation with Gecko: On Metrics, Prompts, and Human Ratings","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16820","snapshot_observed_at":"2026-08-07T14:29:20.385035Z","title":"Revisiting text-to-image evaluation with gecko: On metrics, prompts, and human ratings","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18730","last_updated":"2025-05-24T14:56:09Z","snapshot_observed_at":"2026-08-07T17:06:29.055596Z","submitted_at":"2025-05-24T14:56:09Z","title":"Align Beyond Prompts: Evaluating World Knowledge Alignment in Text-to-Image Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:20.385035Z"},"links":{"cited_paper":"/paper/2404.16820","citing_paper":"/paper/2505.18730"},"observation_digest":"sha256:a0f8fe0890f41d713344db32a7006cfc41a010c65090f3c34038929737960e74","observation_id":"8e87ac9c-38de-46f8-a40f-655a398cedf0","resolution":{"observed_at":"2026-08-07T14:29:20.385035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:20.529173Z","title":"Tune-a-video: One-shot tuning of image diffusion models for text-to-video generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18730","last_updated":"2025-05-24T14:56:09Z","snapshot_observed_at":"2026-08-07T17:06:29.055596Z","submitted_at":"2025-05-24T14:56:09Z","title":"Align Beyond Prompts: Evaluating World Knowledge Alignment in Text-to-Image Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:20.529173Z"},"links":{"citing_paper":"/paper/2505.18730"},"observation_digest":"sha256:9a38d26b231c777314a64d62c63881efbda6462ea514f06003d7dcde81a9fe50","observation_id":"b020c638-43fa-41e1-b516-a4ebdaa05ea0","resolution":{"observed_at":"2026-08-07T14:29:20.529173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09341","last_updated":"2023-09-25T08:19:23Z","snapshot_observed_at":"2026-08-14T02:46:25.655503Z","submitted_at":"2023-06-15T17:59:31Z","title":"Human Preference Score v2: A Solid Benchmark for Evaluating Human Preferences of Text-to-Image Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09341","snapshot_observed_at":"2026-08-07T14:29:20.704757Z","title":"Human preference score v2: A solid benchmark for evaluating human preferences of text-to-image synthesis.arXiv preprint arXiv:2306.09341, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18730","last_updated":"2025-05-24T14:56:09Z","snapshot_observed_at":"2026-08-07T17:06:29.055596Z","submitted_at":"2025-05-24T14:56:09Z","title":"Align Beyond Prompts: Evaluating World Knowledge Alignment in Text-to-Image Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:20.704757Z"},"links":{"cited_paper":"/paper/2306.09341","citing_paper":"/paper/2505.18730"},"observation_digest":"sha256:0acf5afad12d3d47484bdbf7ae3a7e9c0249e3c7ae548ddd7c490254db1621dc","observation_id":"9113fd68-0001-425a-adfe-b640bd8c608d","resolution":{"observed_at":"2026-08-07T14:29:20.704757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14339","last_updated":"2024-08-26T15:08:12Z","snapshot_observed_at":"2026-08-12T22:57:19.543528Z","submitted_at":"2024-08-26T15:08:12Z","title":"ConceptMix: A Compositional Image Generation Benchmark with Controllable Difficulty","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.14339","snapshot_observed_at":"2026-08-07T14:29:20.813586Z","title":"Conceptmix: A com- positional image generation benchmark with controllable difficulty","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18730","last_updated":"2025-05-24T14:56:09Z","snapshot_observed_at":"2026-08-07T17:06:29.055596Z","submitted_at":"2025-05-24T14:56:09Z","title":"Align Beyond Prompts: Evaluating World Knowledge Alignment in Text-to-Image Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:20.813586Z"},"links":{"cited_paper":"/paper/2408.14339","citing_paper":"/paper/2505.18730"},"observation_digest":"sha256:a750581492ce2bf3fdc17be62ee72914a6312a124cd1c732083a6c1145ca9160","observation_id":"fef0d297-ac87-43a2-930d-ca4374b4f151","resolution":{"observed_at":"2026-08-07T14:29:20.813586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:20.939357Z","title":"Imagereward: Learning and evaluating human preferences for text-to-image generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18730","last_updated":"2025-05-24T14:56:09Z","snapshot_observed_at":"2026-08-07T17:06:29.055596Z","submitted_at":"2025-05-24T14:56:09Z","title":"Align Beyond Prompts: Evaluating World Knowledge Alignment in Text-to-Image Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:20.939357Z"},"links":{"citing_paper":"/paper/2505.18730"},"observation_digest":"sha256:4b9becb134a9cc4403774174b8ecc1f2f1e6e1aa684d33598d8d42171b824aea","observation_id":"50fd0ce5-2fc9-4961-bc78-26bd14e21a66","resolution":{"observed_at":"2026-08-07T14:29:20.939357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:22.776727Z","title":"What you see is what you read? improving text-image alignment evaluation","venue":null,"work_id":"68a042d9-aea1-4c29-b964-70665ac52c4c","year":2023},"citing_paper":{"arxiv_id":"2505.18730","last_updated":"2025-05-24T14:56:09Z","snapshot_observed_at":"2026-08-07T17:06:29.055596Z","submitted_at":"2025-05-24T14:56:09Z","title":"Align Beyond Prompts: Evaluating World Knowledge Alignment in Text-to-Image Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:21.069686Z"},"links":{"citing_paper":"/paper/2505.18730"},"observation_digest":"sha256:5f2ef73b36449f676132053b6d4f2b4e3616984376a6770691ad76d6cb593022","observation_id":"622168f4-d83d-4245-b848-2eba141ad681","resolution":{"observed_at":"2026-08-07T14:29:22.890638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-08-14T02:29:38.306439Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-07T14:29:21.180996Z","title":"Scaling autoregressive models for content-rich text-to-image generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18730","last_updated":"2025-05-24T14:56:09Z","snapshot_observed_at":"2026-08-07T17:06:29.055596Z","submitted_at":"2025-05-24T14:56:09Z","title":"Align Beyond Prompts: Evaluating World Knowledge Alignment in Text-to-Image Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:21.180996Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2505.18730"},"observation_digest":"sha256:1e3beeef2850239a95185614d020e8b77a40288d2730edba58f4ddd86f8f7400","observation_id":"ac01512f-127b-4625-9706-5d0f8abe1555","resolution":{"observed_at":"2026-08-07T14:29:21.180996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:21.304097Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18730","last_updated":"2025-05-24T14:56:09Z","snapshot_observed_at":"2026-08-07T17:06:29.055596Z","submitted_at":"2025-05-24T14:56:09Z","title":"Align Beyond Prompts: Evaluating World Knowledge Alignment in Text-to-Image Generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:21.304097Z"},"links":{"citing_paper":"/paper/2505.18730"},"observation_digest":"sha256:85650186c5f4e30ee00ede57e36aee20283ad31911ba8d8f5be967184bc2803d","observation_id":"6c99276e-8e7d-462f-b1c3-637c0ae3a42c","resolution":{"observed_at":"2026-08-07T14:29:21.304097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01361","last_updated":"2023-11-02T16:11:09Z","snapshot_observed_at":"2026-08-13T15:26:41.304406Z","submitted_at":"2023-11-02T16:11:09Z","title":"GPT-4V(ision) as a Generalist Evaluator for Vision-Language Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01361","snapshot_observed_at":"2026-08-07T14:29:21.420118Z","title":"Gpt-4v (ision) as a generalist evaluator for vision-language tasks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18730","last_updated":"2025-05-24T14:56:09Z","snapshot_observed_at":"2026-08-07T17:06:29.055596Z","submitted_at":"2025-05-24T14:56:09Z","title":"Align Beyond Prompts: Evaluating World Knowledge Alignment in Text-to-Image Generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:21.420118Z"},"links":{"cited_paper":"/paper/2311.01361","citing_paper":"/paper/2505.18730"},"observation_digest":"sha256:63ea9fe0f50f78fe2f55f7ea89b9230bb9a086c89d013bb5986ec4ea3258960c","observation_id":"8dfe7e35-1325-4ff5-8fce-280fbc210314","resolution":{"observed_at":"2026-08-07T14:29:21.420118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02338","last_updated":"2023-12-11T07:58:36Z","snapshot_observed_at":"2026-08-13T05:10:01.922934Z","submitted_at":"2023-12-04T20:47:48Z","title":"A Contrastive Compositional Benchmark for Text-to-Image Synthesis: A Study with Unified Text-to-Image Fidelity Metrics","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02338","snapshot_observed_at":"2026-08-07T14:29:21.502877Z","title":"A contrastive compositional benchmark for text-to-image synthesis: A study with unified text-to-image fidelity metrics","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18730","last_updated":"2025-05-24T14:56:09Z","snapshot_observed_at":"2026-08-07T17:06:29.055596Z","submitted_at":"2025-05-24T14:56:09Z","title":"Align Beyond Prompts: Evaluating World Knowledge Alignment in Text-to-Image Generation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:21.502877Z"},"links":{"cited_paper":"/paper/2312.02338","citing_paper":"/paper/2505.18730"},"observation_digest":"sha256:b74227137123ab08c0948a712fd9cd7231afd9284a276e8f2963b1444166f385","observation_id":"53f5a135-43f9-47b5-b72e-db4660a2314f","resolution":{"observed_at":"2026-08-07T14:29:21.502877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.18730","last_updated":"2025-05-24T14:56:09Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T17:06:29.055596Z","submitted_at":"2025-05-24T14:56:09Z","title":"Align Beyond Prompts: Evaluating World Knowledge Alignment in Text-to-Image Generation"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":35,"verified_exact":3,"verified_fuzzy":15},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 1 inbound Pith citation observation for arXiv:2505.18730."}