{"as_of":"2026-08-11T18:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cd491b94ed4a4cd113bd390db011342fea3d6fa48549dea7fbd009fa0df4403a","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":50,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T17:00:06.795847Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-08T05:54:33.534825Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.01291","last_updated":"2024-06-18T07:09:55Z","snapshot_observed_at":"2026-07-06T17:54:07.815827Z","submitted_at":"2024-04-01T17:58:06Z","title":"Evaluating Text-to-Visual Generation with Image-to-Text Generation","version":2},"cited_work":{"arxiv_id":"2404.01291","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.01291","snapshot_observed_at":"2026-07-08T05:54:33.534825Z","title":"Evaluating text-to-visual generation with image-to-text models.preprint","venue":"cs.CV","work_id":"f52d17a0-d6dd-4514-beb8-49201dfe0e89","year":2024},"citing_paper":{"arxiv_id":"2406.03520","last_updated":"2024-10-03T17:24:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-05T17:53:55Z","title":"VideoPhy: Evaluating Physical Commonsense for Video Generation","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-20T11:34:37.599691Z"},"links":{"cited_paper":"/paper/2404.01291","citing_paper":"/paper/2406.03520"},"observation_digest":"sha256:04be06da8cab4ad95946d6508166c2bc0cef8af102b1a1df310d0479c71f49d8","observation_id":"d1ef24b2-4ccd-43b1-aa21-889efb51e838","resolution":{"observed_at":"2026-05-20T11:34:37.681410Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01291","last_updated":"2024-06-18T07:09:55Z","snapshot_observed_at":"2026-07-06T17:54:07.815827Z","submitted_at":"2024-04-01T17:58:06Z","title":"Evaluating Text-to-Visual Generation with Image-to-Text Generation","version":2},"cited_work":{"arxiv_id":"2404.01291","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.01291","snapshot_observed_at":"2026-07-08T05:54:33.534825Z","title":"Evaluating text-to-visual generation with image-to-text models.preprint","venue":"cs.CV","work_id":"f52d17a0-d6dd-4514-beb8-49201dfe0e89","year":2024},"citing_paper":{"arxiv_id":"2409.04429","last_updated":"2025-03-04T16:31:57Z","snapshot_observed_at":"2026-08-01T23:38:04.510222Z","submitted_at":"2024-09-06T17:49:56Z","title":"VILA-U: a Unified Foundation Model Integrating Visual Understanding and Generation","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-16T00:26:21.313005Z"},"links":{"cited_paper":"/paper/2404.01291","citing_paper":"/paper/2409.04429"},"observation_digest":"sha256:5165ce56730838c0d87cd73a6e5c7e670bc4e97ce3eae4f6811a15c3f8cbf26d","observation_id":"96c745dd-1da5-44d2-9fc6-372ca1e8588a","resolution":{"observed_at":"2026-05-16T00:26:21.431602Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01291","last_updated":"2024-06-18T07:09:55Z","snapshot_observed_at":"2026-07-06T17:54:07.815827Z","submitted_at":"2024-04-01T17:58:06Z","title":"Evaluating Text-to-Visual Generation with Image-to-Text Generation","version":2},"cited_work":{"arxiv_id":"2404.01291","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.01291","snapshot_observed_at":"2026-07-08T05:54:33.534825Z","title":"Evaluating text-to-visual generation with image-to-text models.preprint","venue":"cs.CV","work_id":"f52d17a0-d6dd-4514-beb8-49201dfe0e89","year":2024},"citing_paper":{"arxiv_id":"2410.05363","last_updated":"2024-10-07T17:56:04Z","snapshot_observed_at":"2026-08-08T09:48:34.424815Z","submitted_at":"2024-10-07T17:56:04Z","title":"Towards World Simulator: Crafting Physical Commonsense-Based Benchmark for Video Generation","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-18T14:39:59.870039Z"},"links":{"cited_paper":"/paper/2404.01291","citing_paper":"/paper/2410.05363"},"observation_digest":"sha256:3bfb91c7465add86ddb30442dcb9d9c746096e1493826ef656abd229b145ddfe","observation_id":"6368c9ef-7521-4c5e-88f0-bc0195210df1","resolution":{"observed_at":"2026-05-18T14:39:59.994659Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01291","last_updated":"2024-06-18T07:09:55Z","snapshot_observed_at":"2026-07-06T17:54:07.815827Z","submitted_at":"2024-04-01T17:58:06Z","title":"Evaluating Text-to-Visual Generation with Image-to-Text Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01291","snapshot_observed_at":"2026-08-11T17:00:06.795847Z","title":"Evaluating text-to-visual generation with image- to-text generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09545","last_updated":"2024-12-19T00:30:08Z","snapshot_observed_at":"2026-08-11T16:54:02.620487Z","submitted_at":"2024-12-12T18:35:26Z","title":"SimAvatar: Simulation-Ready Avatars with Layered Hair and Clothing","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T17:00:06.795847Z"},"links":{"cited_paper":"/paper/2404.01291","citing_paper":"/paper/2412.09545"},"observation_digest":"sha256:0d5ae1ae67ea32eef6d426d8d91d34bbedd021bf54176409aa08a5c8e95520e5","observation_id":"9059e584-5189-493e-bcfd-23d985e94404","resolution":{"observed_at":"2026-08-11T17:00:06.795847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01291","last_updated":"2024-06-18T07:09:55Z","snapshot_observed_at":"2026-07-06T17:54:07.815827Z","submitted_at":"2024-04-01T17:58:06Z","title":"Evaluating Text-to-Visual Generation with Image-to-Text Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01291","snapshot_observed_at":"2026-08-11T15:50:16.782526Z","title":"Evaluating text-to-visual generation with image-to-text generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10604","last_updated":"2024-12-18T17:49:32Z","snapshot_observed_at":"2026-08-11T15:45:27.406741Z","submitted_at":"2024-12-13T23:15:35Z","title":"EvalGIM: A Library for Evaluating Generative Image Models","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-11T15:50:16.782526Z"},"links":{"cited_paper":"/paper/2404.01291","citing_paper":"/paper/2412.10604"},"observation_digest":"sha256:7eaae5b8fa2181aa67343f4b4cf60287fdfce175243d3bfc81fe14052da59375","observation_id":"dc21e26a-3f0f-4fd5-ac97-0fb053ab1d2c","resolution":{"observed_at":"2026-08-11T15:50:16.782526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01291","last_updated":"2024-06-18T07:09:55Z","snapshot_observed_at":"2026-07-06T17:54:07.815827Z","submitted_at":"2024-04-01T17:58:06Z","title":"Evaluating Text-to-Visual Generation with Image-to-Text Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01291","snapshot_observed_at":"2026-08-10T17:05:50.701277Z","title":"Evaluating text-to-visual generation with image-to-text gen- eration","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12612","last_updated":"2025-07-25T08:18:26Z","snapshot_observed_at":"2026-08-10T16:57:34.271042Z","submitted_at":"2025-01-22T03:29:43Z","title":"T2ISafety: Benchmark for Assessing Fairness, Toxicity, and Privacy in Image Generation","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T17:05:50.701277Z"},"links":{"cited_paper":"/paper/2404.01291","citing_paper":"/paper/2501.12612"},"observation_digest":"sha256:0e747b67dfc1f7e40ad5b7000c903fab6b223bc57439fa325bb309f2f0206fb0","observation_id":"34d0c6d6-07e8-4428-bc38-eb571007e9e0","resolution":{"observed_at":"2026-08-10T17:05:50.701277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01291","last_updated":"2024-06-18T07:09:55Z","snapshot_observed_at":"2026-07-06T17:54:07.815827Z","submitted_at":"2024-04-01T17:58:06Z","title":"Evaluating Text-to-Visual Generation with Image-to-Text Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01291","snapshot_observed_at":"2026-08-09T04:23:01.155996Z","title":"Evaluating text-to-visual generation with image-to-text gen- eration","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.03629","last_updated":"2025-04-29T00:30:03Z","snapshot_observed_at":"2026-08-09T05:59:13.183608Z","submitted_at":"2025-02-05T21:35:48Z","title":"REALEDIT: Reddit Edits As a Large-scale Empirical Dataset for Image Transformations","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-09T04:23:01.155996Z"},"links":{"cited_paper":"/paper/2404.01291","citing_paper":"/paper/2502.03629"},"observation_digest":"sha256:1d54d0b6c039f8650fb644493259bf31fdf5468e829301fa1ca814bda01854d6","observation_id":"18a26062-eb2c-4113-b79a-684088bde622","resolution":{"observed_at":"2026-08-09T04:23:01.155996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01291","last_updated":"2024-06-18T07:09:55Z","snapshot_observed_at":"2026-07-06T17:54:07.815827Z","submitted_at":"2024-04-01T17:58:06Z","title":"Evaluating Text-to-Visual Generation with Image-to-Text Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01291","snapshot_observed_at":"2026-08-08T19:37:19.811973Z","title":"In Computer Graphics Forum, Vol","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06860","last_updated":"2025-08-22T06:58:44Z","snapshot_observed_at":"2026-08-09T16:00:58.152151Z","submitted_at":"2025-02-07T23:57:22Z","title":"AutoSketch: VLM-assisted Style-Aware Vector Sketch Completion","version":3},"reference_index":2013,"source":"pdf_text","source_observed_at":"2026-08-08T19:37:19.811973Z"},"links":{"cited_paper":"/paper/2404.01291","citing_paper":"/paper/2502.06860"},"observation_digest":"sha256:56b35d50a117764b1ea26f5d57f229bd3958e99b918bb06e9d8b99986896c408","observation_id":"6e0ec614-d48d-4cff-9a29-373da8aad3e3","resolution":{"observed_at":"2026-08-08T19:37:19.811973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01291","last_updated":"2024-06-18T07:09:55Z","snapshot_observed_at":"2026-07-06T17:54:07.815827Z","submitted_at":"2024-04-01T17:58:06Z","title":"Evaluating Text-to-Visual Generation with Image-to-Text Generation","version":2},"cited_work":{"arxiv_id":"2404.01291","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.01291","snapshot_observed_at":"2026-07-08T05:54:33.534825Z","title":"Evaluating text-to-visual generation with image-to-text models.preprint","venue":"cs.CV","work_id":"f52d17a0-d6dd-4514-beb8-49201dfe0e89","year":2024},"citing_paper":{"arxiv_id":"2503.07265","last_updated":"2026-06-02T17:11:50Z","snapshot_observed_at":"2026-08-07T17:17:00.060047Z","submitted_at":"2025-03-10T12:47:53Z","title":"WISE: A World Knowledge-Informed Semantic Evaluation for Text-to-Image Generation","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-15T16:24:27.407376Z"},"links":{"cited_paper":"/paper/2404.01291","citing_paper":"/paper/2503.07265"},"observation_digest":"sha256:d57c8019fb3aa995e9e11de1ca5225398c18b68d18f8e47b39f39a66335abc30","observation_id":"d03f741a-1100-4821-bbbf-9beb1d706efe","resolution":{"observed_at":"2026-05-15T16:24:27.675197Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01291","last_updated":"2024-06-18T07:09:55Z","snapshot_observed_at":"2026-07-06T17:54:07.815827Z","submitted_at":"2024-04-01T17:58:06Z","title":"Evaluating Text-to-Visual Generation with Image-to-Text Generation","version":2},"cited_work":{"arxiv_id":"2404.01291","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.01291","snapshot_observed_at":"2026-07-08T05:54:33.534825Z","title":"Evaluating text-to-visual generation with image-to-text models.preprint","venue":"cs.CV","work_id":"f52d17a0-d6dd-4514-beb8-49201dfe0e89","year":2024},"citing_paper":{"arxiv_id":"2503.07703","last_updated":"2025-03-10T17:58:33Z","snapshot_observed_at":"2026-07-06T20:50:09.622181Z","submitted_at":"2025-03-10T17:58:33Z","title":"Seedream 2.0: A Native Chinese-English Bilingual Image Generation Foundation Model","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-17T08:27:36.242416Z"},"links":{"cited_paper":"/paper/2404.01291","citing_paper":"/paper/2503.07703"},"observation_digest":"sha256:f1e4e60d085408a23ad5a9f8e8f5a29ddae97da9228291eddb5608cefe73d442","observation_id":"98c45371-cbd6-4c4e-9547-7022b77eace7","resolution":{"observed_at":"2026-05-17T08:27:36.315598Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01291","last_updated":"2024-06-18T07:09:55Z","snapshot_observed_at":"2026-07-06T17:54:07.815827Z","submitted_at":"2024-04-01T17:58:06Z","title":"Evaluating Text-to-Visual Generation with Image-to-Text Generation","version":2},"cited_work":{"arxiv_id":"2404.01291","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.01291","snapshot_observed_at":"2026-07-08T05:54:33.534825Z","title":"Evaluating text-to-visual generation with image-to-text models.preprint","venue":"cs.CV","work_id":"f52d17a0-d6dd-4514-beb8-49201dfe0e89","year":2024},"citing_paper":{"arxiv_id":"2505.05472","last_updated":"2025-05-11T18:47:18Z","snapshot_observed_at":"2026-08-04T22:02:38.792513Z","submitted_at":"2025-05-08T17:58:57Z","title":"Mogao: An Omni Foundation Model for Interleaved Multi-Modal Generation","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-17T07:24:04.460276Z"},"links":{"cited_paper":"/paper/2404.01291","citing_paper":"/paper/2505.05472"},"observation_digest":"sha256:ca3e5c138b18b3ad598decfd4c5fe0cae6590640132394ac6170e63d20847c99","observation_id":"b9b180b0-a051-498e-a748-04f6ced31318","resolution":{"observed_at":"2026-05-17T07:24:04.897426Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01291","last_updated":"2024-06-18T07:09:55Z","snapshot_observed_at":"2026-07-06T17:54:07.815827Z","submitted_at":"2024-04-01T17:58:06Z","title":"Evaluating Text-to-Visual Generation with Image-to-Text Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01291","snapshot_observed_at":"2026-08-07T14:15:46.589608Z","title":"Evaluating text-to-visual generation with image-to-text generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19535","last_updated":"2025-05-26T05:47:09Z","snapshot_observed_at":"2026-08-08T09:36:17.755126Z","submitted_at":"2025-05-26T05:47:09Z","title":"TDVE-Assessor: Benchmarking and Evaluating the Quality of Text-Driven Video Editing with LMMs","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:46.589608Z"},"links":{"cited_paper":"/paper/2404.01291","citing_paper":"/paper/2505.19535"},"observation_digest":"sha256:9316688af8c68797152efb8a36f1e0271c51474ac12b4227115363d8be5e9366","observation_id":"0082d370-eec2-4389-a745-f24588fd8b08","resolution":{"observed_at":"2026-08-07T14:15:46.589608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01291","last_updated":"2024-06-18T07:09:55Z","snapshot_observed_at":"2026-07-06T17:54:07.815827Z","submitted_at":"2024-04-01T17:58:06Z","title":"Evaluating Text-to-Visual Generation with Image-to-Text Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01291","snapshot_observed_at":"2026-08-07T13:08:04.662605Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22613","last_updated":"2025-05-28T17:29:34Z","snapshot_observed_at":"2026-08-07T13:00:45.454980Z","submitted_at":"2025-05-28T17:29:34Z","title":"RICO: Improving Accuracy and Completeness in Image Recaptioning via Visual Reconstruction","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T13:08:04.662605Z"},"links":{"cited_paper":"/paper/2404.01291","citing_paper":"/paper/2505.22613"},"observation_digest":"sha256:40b045fb06a4d1c5a1d72dc5978133e5df69283596255aff672a1f86b3b8489a","observation_id":"f79b9c52-9e3f-46e8-9e9a-96587df0c713","resolution":{"observed_at":"2026-08-07T13:08:04.662605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01291","last_updated":"2024-06-18T07:09:55Z","snapshot_observed_at":"2026-07-06T17:54:07.815827Z","submitted_at":"2024-04-01T17:58:06Z","title":"Evaluating Text-to-Visual Generation with Image-to-Text Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01291","snapshot_observed_at":"2026-08-07T05:14:42.136106Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08480","last_updated":"2025-06-10T06:11:36Z","snapshot_observed_at":"2026-08-08T07:29:37.673155Z","submitted_at":"2025-06-10T06:11:36Z","title":"Re-Thinking the Automatic Evaluation of Image-Text Alignment in Text-to-Image Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:42.136106Z"},"links":{"cited_paper":"/paper/2404.01291","citing_paper":"/paper/2506.08480"},"observation_digest":"sha256:9c5ffe5f38ca9bab56451db6e27b860e6f6a0938f47b854b274c97feb2bd4a00","observation_id":"703f16e1-cf9f-40a6-b78c-b678b5ea79e7","resolution":{"observed_at":"2026-08-07T05:14:42.136106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01291","last_updated":"2024-06-18T07:09:55Z","snapshot_observed_at":"2026-07-06T17:54:07.815827Z","submitted_at":"2024-04-01T17:58:06Z","title":"Evaluating Text-to-Visual Generation with Image-to-Text Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01291","snapshot_observed_at":"2026-08-06T21:48:54.778142Z","title":"Evaluating text-to-visual generation with image-to-text generation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23418","last_updated":"2025-06-29T22:41:27Z","snapshot_observed_at":"2026-08-08T07:48:39.269731Z","submitted_at":"2025-06-29T22:41:27Z","title":"Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T21:48:54.778142Z"},"links":{"cited_paper":"/paper/2404.01291","citing_paper":"/paper/2506.23418"},"observation_digest":"sha256:29c02675a5321ad472d1843ee9db5ec90206524795d283de2a2a9b2a5557f15c","observation_id":"babd993d-63a6-4fb9-89a9-c3b2f7b3f4cd","resolution":{"observed_at":"2026-08-06T21:48:54.778142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01291","last_updated":"2024-06-18T07:09:55Z","snapshot_observed_at":"2026-07-06T17:54:07.815827Z","submitted_at":"2024-04-01T17:58:06Z","title":"Evaluating Text-to-Visual Generation with Image-to-Text Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01291","snapshot_observed_at":"2026-08-06T18:50:43.571364Z","title":"Evaluating Text-to-Visual Generation with Image-to-Text Generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08039","last_updated":"2025-07-09T18:40:17Z","snapshot_observed_at":"2026-08-10T19:44:59.093869Z","submitted_at":"2025-07-09T18:40:17Z","title":"Towards Evaluating Robustness of Prompt Adherence in Text to Image Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T18:50:43.571364Z"},"links":{"cited_paper":"/paper/2404.01291","citing_paper":"/paper/2507.08039"},"observation_digest":"sha256:124dd54ce3d53777cf3da567cc9e5f18f9b46822451e7f2810661998b27b04ef","observation_id":"df232a2a-1dff-4718-8067-9a7be0277a95","resolution":{"observed_at":"2026-08-06T18:50:43.571364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01291","last_updated":"2024-06-18T07:09:55Z","snapshot_observed_at":"2026-07-06T17:54:07.815827Z","submitted_at":"2024-04-01T17:58:06Z","title":"Evaluating Text-to-Visual Generation with Image-to-Text Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01291","snapshot_observed_at":"2026-08-06T00:52:46.101151Z","title":"Evaluating text-to-visual generation with image-to-text generation.arXiv preprint arXiv:2404.01291, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06555","last_updated":"2025-08-12T02:32:24Z","snapshot_observed_at":"2026-08-06T00:52:41.478354Z","submitted_at":"2025-08-06T08:42:42Z","title":"StyleTailor: Towards Personalized Fashion Styling via Hierarchical Negative Feedback","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T00:52:46.101151Z"},"links":{"cited_paper":"/paper/2404.01291","citing_paper":"/paper/2508.06555"},"observation_digest":"sha256:f3dbb5a7e6d80d885154e9c878df1579241c1a94cbd243e9b110edb024e9368b","observation_id":"67375651-a6ec-40c5-abf9-2ca8678f0965","resolution":{"observed_at":"2026-08-06T00:52:46.101151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01291","last_updated":"2024-06-18T07:09:55Z","snapshot_observed_at":"2026-07-06T17:54:07.815827Z","submitted_at":"2024-04-01T17:58:06Z","title":"Evaluating Text-to-Visual Generation with Image-to-Text Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01291","snapshot_observed_at":"2026-08-05T20:44:13.931759Z","title":"Evaluating text-to-visual generation with image-to-text generation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-09T07:45:34.680113Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:13.931759Z"},"links":{"cited_paper":"/paper/2404.01291","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:82e36683d5e9724163ef912d30032f1413aba628df045f576ff19fdf42aa7791","observation_id":"15f05b24-c517-4cf2-a712-3970452c8e49","resolution":{"observed_at":"2026-08-05T20:44:13.931759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01291","last_updated":"2024-06-18T07:09:55Z","snapshot_observed_at":"2026-07-06T17:54:07.815827Z","submitted_at":"2024-04-01T17:58:06Z","title":"Evaluating Text-to-Visual Generation with Image-to-Text Generation","version":2},"cited_work":{"arxiv_id":"2404.01291","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.01291","snapshot_observed_at":"2026-07-08T05:54:33.534825Z","title":"Evaluating text-to-visual generation with image-to-text models.preprint","venue":"cs.CV","work_id":"f52d17a0-d6dd-4514-beb8-49201dfe0e89","year":2024},"citing_paper":{"arxiv_id":"2511.07756","last_updated":"2026-05-11T15:40:18Z","snapshot_observed_at":"2026-08-03T11:14:03.491358Z","submitted_at":"2025-11-11T02:12:38Z","title":"Determinism of Randomness: Prompt-Residual Seed Shaping for Diffusion Generation","version":6},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-18T00:13:15.606804Z"},"links":{"cited_paper":"/paper/2404.01291","citing_paper":"/paper/2511.07756"},"observation_digest":"sha256:83155a6793197694ca169d988b1e1bf44c6ab584ba2c6d636b4207c216da133c","observation_id":"3f1284d8-18ed-4fd3-9214-978f4bab7dea","resolution":{"observed_at":"2026-05-18T00:15:31.732222Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01291","last_updated":"2024-06-18T07:09:55Z","snapshot_observed_at":"2026-07-06T17:54:07.815827Z","submitted_at":"2024-04-01T17:58:06Z","title":"Evaluating Text-to-Visual Generation with Image-to-Text Generation","version":2},"cited_work":{"arxiv_id":"2404.01291","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.01291","snapshot_observed_at":"2026-07-08T05:54:33.534825Z","title":"Evaluating text-to-visual generation with image-to-text models.preprint","venue":"cs.CV","work_id":"f52d17a0-d6dd-4514-beb8-49201dfe0e89","year":2024},"citing_paper":{"arxiv_id":"2511.17171","last_updated":"2026-05-22T12:44:18Z","snapshot_observed_at":"2026-08-10T21:17:16.890967Z","submitted_at":"2025-11-21T11:45:22Z","title":"FireScope: Wildfire Risk Raster Prediction with a Chain-of-Thought Oracle","version":5},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-17T20:45:15.034196Z"},"links":{"cited_paper":"/paper/2404.01291","citing_paper":"/paper/2511.17171"},"observation_digest":"sha256:6ad9a8145d167660816fbee73486659dc6d87f056934179f529bb5e0035f5a7f","observation_id":"1bb93abf-c03d-43d4-affd-f5561060af96","resolution":{"observed_at":"2026-05-17T20:50:15.301742Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01291","last_updated":"2024-06-18T07:09:55Z","snapshot_observed_at":"2026-07-06T17:54:07.815827Z","submitted_at":"2024-04-01T17:58:06Z","title":"Evaluating Text-to-Visual Generation with Image-to-Text Generation","version":2},"cited_work":{"arxiv_id":"2404.01291","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.01291","snapshot_observed_at":"2026-07-08T05:54:33.534825Z","title":"Evaluating text-to-visual generation with image-to-text models.preprint","venue":"cs.CV","work_id":"f52d17a0-d6dd-4514-beb8-49201dfe0e89","year":2024},"citing_paper":{"arxiv_id":"2511.17171","last_updated":"2026-05-22T12:44:18Z","snapshot_observed_at":"2026-08-10T21:17:16.890967Z","submitted_at":"2025-11-21T11:45:22Z","title":"FireScope: Wildfire Risk Raster Prediction with a Chain-of-Thought Oracle","version":6},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-25T07:17:26.381232Z"},"links":{"cited_paper":"/paper/2404.01291","citing_paper":"/paper/2511.17171"},"observation_digest":"sha256:7106a751cb99c505516c6489e4395196062120619fddf7e4736f64006e6e6772","observation_id":"e7ee3650-3c75-4ebc-9673-43051eeabe99","resolution":{"observed_at":"2026-05-25T07:20:28.805804Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01291","last_updated":"2024-06-18T07:09:55Z","snapshot_observed_at":"2026-07-06T17:54:07.815827Z","submitted_at":"2024-04-01T17:58:06Z","title":"Evaluating Text-to-Visual Generation with Image-to-Text Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01291","snapshot_observed_at":"2026-08-03T17:49:11.784837Z","title":"Evaluating text-to-visual generation with image-to-text generation.arXiv preprint arXiv:2404.01291,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.08180","last_updated":"2026-06-09T07:26:39Z","snapshot_observed_at":"2026-08-09T15:37:32.095500Z","submitted_at":"2025-12-09T02:22:23Z","title":"GeoLoom: High-quality Geometric Diagram Generation from Textual Input","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T17:49:11.784837Z"},"links":{"cited_paper":"/paper/2404.01291","citing_paper":"/paper/2512.08180"},"observation_digest":"sha256:eb890ae3db4b0694be8a461c02c60d40d34d8d7560071b72d5e12aa05975b196","observation_id":"82693605-52dd-49eb-9436-2e8bfd40d697","resolution":{"observed_at":"2026-08-03T17:49:11.784837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01291","last_updated":"2024-06-18T07:09:55Z","snapshot_observed_at":"2026-07-06T17:54:07.815827Z","submitted_at":"2024-04-01T17:58:06Z","title":"Evaluating Text-to-Visual Generation with Image-to-Text Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01291","snapshot_observed_at":"2026-08-03T11:52:45.814202Z","title":"Hanjun Luo, Haoyu Huang, Ziye Deng, Xinfeng Li, Hewei Wang, Yingbin Jin, Yang Liu, Wenyuan Xu, and Zuozhu Liu","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.04946","last_updated":"2026-06-01T13:55:11Z","snapshot_observed_at":"2026-08-09T12:03:17.550557Z","submitted_at":"2026-01-08T13:49:14Z","title":"Prototypicality Bias Reveals Blindspots in Multimodal Evaluation Metrics","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T11:52:45.814202Z"},"links":{"cited_paper":"/paper/2404.01291","citing_paper":"/paper/2601.04946"},"observation_digest":"sha256:d514755a1149d7ab3bca550921ad6ff4dd1a768e47ba27cced7c070879852b86","observation_id":"92cbd170-d91e-4abd-9425-d1a11748ed30","resolution":{"observed_at":"2026-08-03T11:52:45.814202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01291","last_updated":"2024-06-18T07:09:55Z","snapshot_observed_at":"2026-07-06T17:54:07.815827Z","submitted_at":"2024-04-01T17:58:06Z","title":"Evaluating Text-to-Visual Generation with Image-to-Text Generation","version":2},"cited_work":{"arxiv_id":"2404.01291","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.01291","snapshot_observed_at":"2026-07-08T05:54:33.534825Z","title":"Evaluating text-to-visual generation with image-to-text models.preprint","venue":"cs.CV","work_id":"f52d17a0-d6dd-4514-beb8-49201dfe0e89","year":2024},"citing_paper":{"arxiv_id":"2602.03342","last_updated":"2026-04-10T10:13:54Z","snapshot_observed_at":"2026-07-06T22:44:18.875334Z","submitted_at":"2026-02-03T10:09:27Z","title":"Tiled Prompts: Overcoming Prompt Misguidance in Image and Video Super-Resolution","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-16T08:32:16.532299Z"},"links":{"cited_paper":"/paper/2404.01291","citing_paper":"/paper/2602.03342"},"observation_digest":"sha256:1ed26536abd9bffaa8458bb6757166e5f53803f88db06add4a4df2b9191494e4","observation_id":"549c1047-dbb4-4048-99ee-a67f443d2dee","resolution":{"observed_at":"2026-05-16T08:32:36.336186Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01291","last_updated":"2024-06-18T07:09:55Z","snapshot_observed_at":"2026-07-06T17:54:07.815827Z","submitted_at":"2024-04-01T17:58:06Z","title":"Evaluating Text-to-Visual Generation with Image-to-Text Generation","version":2},"cited_work":{"arxiv_id":"2404.01291","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.01291","snapshot_observed_at":"2026-07-08T05:54:33.534825Z","title":"Evaluating text-to-visual generation with image-to-text models.preprint","venue":"cs.CV","work_id":"f52d17a0-d6dd-4514-beb8-49201dfe0e89","year":2024},"citing_paper":{"arxiv_id":"2604.00799","last_updated":"2026-04-02T21:20:30Z","snapshot_observed_at":"2026-08-11T12:52:26.203109Z","submitted_at":"2026-04-01T12:06:54Z","title":"Multimodal Language Models Cannot Spot Spatial Inconsistencies","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-13T23:12:27.333405Z"},"links":{"cited_paper":"/paper/2404.01291","citing_paper":"/paper/2604.00799"},"observation_digest":"sha256:1cd124b7ce894af04f3c7fc8ef83d23937a9ba18c4b1e8ec915f15472965ce24","observation_id":"1b0ba704-665b-4cb9-9591-83fd4ffb39b0","resolution":{"observed_at":"2026-05-13T23:13:24.810235Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01291","last_updated":"2024-06-18T07:09:55Z","snapshot_observed_at":"2026-07-06T17:54:07.815827Z","submitted_at":"2024-04-01T17:58:06Z","title":"Evaluating Text-to-Visual Generation with Image-to-Text Generation","version":2},"cited_work":{"arxiv_id":"2404.01291","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.01291","snapshot_observed_at":"2026-07-08T05:54:33.534825Z","title":"Evaluating text-to-visual generation with image-to-text models.preprint","venue":"cs.CV","work_id":"f52d17a0-d6dd-4514-beb8-49201dfe0e89","year":2024},"citing_paper":{"arxiv_id":"2604.02406","last_updated":"2026-05-16T00:42:12Z","snapshot_observed_at":"2026-08-11T18:29:23.009488Z","submitted_at":"2026-04-02T17:17:12Z","title":"Evaluating AI-Generated Images of Cultural Artifacts with Community-Informed Rubrics","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-13T20:59:52.448832Z"},"links":{"cited_paper":"/paper/2404.01291","citing_paper":"/paper/2604.02406"},"observation_digest":"sha256:0d82d07fbbba0f08c3dea64c1e1dcfef2baff7bf7ec173b376b3632dc335baf5","observation_id":"ce9ea81a-ed56-4c08-84ba-c45c4ab4dbec","resolution":{"observed_at":"2026-05-13T21:03:20.088448Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01291","last_updated":"2024-06-18T07:09:55Z","snapshot_observed_at":"2026-07-06T17:54:07.815827Z","submitted_at":"2024-04-01T17:58:06Z","title":"Evaluating Text-to-Visual Generation with Image-to-Text Generation","version":2},"cited_work":{"arxiv_id":"2404.01291","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.01291","snapshot_observed_at":"2026-07-08T05:54:33.534825Z","title":"Evaluating text-to-visual generation with image-to-text models.preprint","venue":"cs.CV","work_id":"f52d17a0-d6dd-4514-beb8-49201dfe0e89","year":2024},"citing_paper":{"arxiv_id":"2604.02406","last_updated":"2026-05-16T00:42:12Z","snapshot_observed_at":"2026-08-11T18:29:23.009488Z","submitted_at":"2026-04-02T17:17:12Z","title":"Evaluating AI-Generated Images of Cultural Artifacts with Community-Informed Rubrics","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-21T10:35:39.269869Z"},"links":{"cited_paper":"/paper/2404.01291","citing_paper":"/paper/2604.02406"},"observation_digest":"sha256:ba10486702acd556e5b7d1b4c7519ce8b62e506f818433b66c57cf67da735b7e","observation_id":"64b1904c-15dc-4891-a05f-7ac9c262e9f1","resolution":{"observed_at":"2026-05-21T10:40:00.846699Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01291","last_updated":"2024-06-18T07:09:55Z","snapshot_observed_at":"2026-07-06T17:54:07.815827Z","submitted_at":"2024-04-01T17:58:06Z","title":"Evaluating Text-to-Visual Generation with Image-to-Text Generation","version":2},"cited_work":{"arxiv_id":"2404.01291","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.01291","snapshot_observed_at":"2026-07-08T05:54:33.534825Z","title":"Evaluating text-to-visual generation with image-to-text models.preprint","venue":"cs.CV","work_id":"f52d17a0-d6dd-4514-beb8-49201dfe0e89","year":2024},"citing_paper":{"arxiv_id":"2604.08664","last_updated":"2026-04-09T18:00:05Z","snapshot_observed_at":"2026-07-06T22:57:45.084987Z","submitted_at":"2026-04-09T18:00:05Z","title":"Generative Simulation for Policy Learning in Physical Human-Robot Interaction","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-10T17:06:58.099881Z"},"links":{"cited_paper":"/paper/2404.01291","citing_paper":"/paper/2604.08664"},"observation_digest":"sha256:ec340af09b7c2d64ad4f4ed977f38093953888ba97649c3918292e6ef697162f","observation_id":"1f043b2d-0ca3-427e-adbe-25b5684622cd","resolution":{"observed_at":"2026-05-11T07:35:57.556101Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01291","last_updated":"2024-06-18T07:09:55Z","snapshot_observed_at":"2026-07-06T17:54:07.815827Z","submitted_at":"2024-04-01T17:58:06Z","title":"Evaluating Text-to-Visual Generation with Image-to-Text Generation","version":2},"cited_work":{"arxiv_id":"2404.01291","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.01291","snapshot_observed_at":"2026-07-08T05:54:33.534825Z","title":"Evaluating text-to-visual generation with image-to-text models.preprint","venue":"cs.CV","work_id":"f52d17a0-d6dd-4514-beb8-49201dfe0e89","year":2024},"citing_paper":{"arxiv_id":"2604.09860","last_updated":"2026-05-14T17:31:57Z","snapshot_observed_at":"2026-08-03T02:21:58.413211Z","submitted_at":"2026-04-10T19:42:21Z","title":"RoboLab: A High-Fidelity Simulation Benchmark for Analysis of Task Generalist Policies","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T16:46:16.091095Z"},"links":{"cited_paper":"/paper/2404.01291","citing_paper":"/paper/2604.09860"},"observation_digest":"sha256:818ef6d03d115ebb65feecbf0959d9905b15a7a45459c0bfd5047b931fb51bab","observation_id":"7ec12550-e300-40a6-a992-993cfbec5fa2","resolution":{"observed_at":"2026-05-11T08:11:04.978677Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01291","last_updated":"2024-06-18T07:09:55Z","snapshot_observed_at":"2026-07-06T17:54:07.815827Z","submitted_at":"2024-04-01T17:58:06Z","title":"Evaluating Text-to-Visual Generation with Image-to-Text Generation","version":2},"cited_work":{"arxiv_id":"2404.01291","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.01291","snapshot_observed_at":"2026-07-08T05:54:33.534825Z","title":"Evaluating text-to-visual generation with image-to-text models.preprint","venue":"cs.CV","work_id":"f52d17a0-d6dd-4514-beb8-49201dfe0e89","year":2024},"citing_paper":{"arxiv_id":"2604.09860","last_updated":"2026-05-14T17:31:57Z","snapshot_observed_at":"2026-08-03T02:21:58.413211Z","submitted_at":"2026-04-10T19:42:21Z","title":"RoboLab: A High-Fidelity Simulation Benchmark for Analysis of Task Generalist Policies","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-15T06:28:08.468872Z"},"links":{"cited_paper":"/paper/2404.01291","citing_paper":"/paper/2604.09860"},"observation_digest":"sha256:64dc22989b492b48e5d16105416dde3a5d85223bc9bfcb42c6b56d1303e84c4f","observation_id":"a5f563db-b279-4e67-a07d-ecd8a3ea374a","resolution":{"observed_at":"2026-05-15T06:29:49.685564Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01291","last_updated":"2024-06-18T07:09:55Z","snapshot_observed_at":"2026-07-06T17:54:07.815827Z","submitted_at":"2024-04-01T17:58:06Z","title":"Evaluating Text-to-Visual Generation with Image-to-Text Generation","version":2},"cited_work":{"arxiv_id":"2404.01291","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.01291","snapshot_observed_at":"2026-07-08T05:54:33.534825Z","title":"Evaluating text-to-visual generation with image-to-text models.preprint","venue":"cs.CV","work_id":"f52d17a0-d6dd-4514-beb8-49201dfe0e89","year":2024},"citing_paper":{"arxiv_id":"2604.11496","last_updated":"2026-04-16T10:51:43Z","snapshot_observed_at":"2026-08-03T05:45:05.795046Z","submitted_at":"2026-04-13T14:03:18Z","title":"Revisiting Compositionality in Dual-Encoder Vision-Language Models: The Role of Inference","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T16:38:00.522094Z"},"links":{"cited_paper":"/paper/2404.01291","citing_paper":"/paper/2604.11496"},"observation_digest":"sha256:07ef216cfe189a9ca029b56eff0f772935e6685b9421875376d7ea1f9f7c1821","observation_id":"3d6ad382-a72e-4b9e-9ff7-eeb5aa843de3","resolution":{"observed_at":"2026-05-11T08:26:01.797365Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01291","last_updated":"2024-06-18T07:09:55Z","snapshot_observed_at":"2026-07-06T17:54:07.815827Z","submitted_at":"2024-04-01T17:58:06Z","title":"Evaluating Text-to-Visual Generation with Image-to-Text Generation","version":2},"cited_work":{"arxiv_id":"2404.01291","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.01291","snapshot_observed_at":"2026-07-08T05:54:33.534825Z","title":"Evaluating text-to-visual generation with image-to-text models.preprint","venue":"cs.CV","work_id":"f52d17a0-d6dd-4514-beb8-49201dfe0e89","year":2024},"citing_paper":{"arxiv_id":"2604.20157","last_updated":"2026-04-22T03:51:19Z","snapshot_observed_at":"2026-08-11T11:54:14.700898Z","submitted_at":"2026-04-22T03:51:19Z","title":"HumanScore: Benchmarking Human Motions in Generated Videos","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T01:17:16.513512Z"},"links":{"cited_paper":"/paper/2404.01291","citing_paper":"/paper/2604.20157"},"observation_digest":"sha256:7fb9bb4d4bb0eb7f5ac887732b82727555cf36b8b2958700e77b63a819a24c04","observation_id":"eec96584-3a22-41e4-972c-84cb1601bb34","resolution":{"observed_at":"2026-05-11T13:41:04.395939Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01291","last_updated":"2024-06-18T07:09:55Z","snapshot_observed_at":"2026-07-06T17:54:07.815827Z","submitted_at":"2024-04-01T17:58:06Z","title":"Evaluating Text-to-Visual Generation with Image-to-Text Generation","version":2},"cited_work":{"arxiv_id":"2404.01291","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.01291","snapshot_observed_at":"2026-07-08T05:54:33.534825Z","title":"Evaluating text-to-visual generation with image-to-text models.preprint","venue":"cs.CV","work_id":"f52d17a0-d6dd-4514-beb8-49201dfe0e89","year":2024},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-11T01:00:18.605708Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"cited_paper":"/paper/2404.01291","citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:7b14ce3ef09c0f70f9fc8709f0325359538be81d321ea7ffbaee164cb0f0eae2","observation_id":"610a4531-40be-463b-9e7c-4064aefe9996","resolution":{"observed_at":"2026-05-11T13:46:04.455477Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01291","last_updated":"2024-06-18T07:09:55Z","snapshot_observed_at":"2026-07-06T17:54:07.815827Z","submitted_at":"2024-04-01T17:58:06Z","title":"Evaluating Text-to-Visual Generation with Image-to-Text Generation","version":2},"cited_work":{"arxiv_id":"2404.01291","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.01291","snapshot_observed_at":"2026-07-08T05:54:33.534825Z","title":"Evaluating text-to-visual generation with image-to-text models.preprint","venue":"cs.CV","work_id":"f52d17a0-d6dd-4514-beb8-49201dfe0e89","year":2024},"citing_paper":{"arxiv_id":"2605.07477","last_updated":"2026-05-08T09:23:26Z","snapshot_observed_at":"2026-08-11T08:06:01.163269Z","submitted_at":"2026-05-08T09:23:26Z","title":"ReasonEdit: Towards Interpretable Image Editing Evaluation via Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-11T01:51:42.304051Z"},"links":{"cited_paper":"/paper/2404.01291","citing_paper":"/paper/2605.07477"},"observation_digest":"sha256:ed7114e77d2c0bd26cc4976979b100fd346df1cf382f5062df65ecfc68f1d142","observation_id":"b398580e-9eb8-4496-950a-496a77b3ae8a","resolution":{"observed_at":"2026-05-11T04:15:59.750940Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01291","last_updated":"2024-06-18T07:09:55Z","snapshot_observed_at":"2026-07-06T17:54:07.815827Z","submitted_at":"2024-04-01T17:58:06Z","title":"Evaluating Text-to-Visual Generation with Image-to-Text Generation","version":2},"cited_work":{"arxiv_id":"2404.01291","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.01291","snapshot_observed_at":"2026-07-08T05:54:33.534825Z","title":"Evaluating text-to-visual generation with image-to-text models.preprint","venue":"cs.CV","work_id":"f52d17a0-d6dd-4514-beb8-49201dfe0e89","year":2024},"citing_paper":{"arxiv_id":"2605.22469","last_updated":"2026-05-21T13:28:36Z","snapshot_observed_at":"2026-07-06T23:32:49.530788Z","submitted_at":"2026-05-21T13:28:36Z","title":"MaSC: A Masked Similarity Metric for Evaluating Concept-Driven Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-22T06:46:19.367708Z"},"links":{"cited_paper":"/paper/2404.01291","citing_paper":"/paper/2605.22469"},"observation_digest":"sha256:cc8f1f4ae458aabcd43960dea6a7160131729ff3716fc884de5e75b460c09850","observation_id":"e5c59264-63a6-4e64-847a-012716b9adaf","resolution":{"observed_at":"2026-05-22T06:51:11.484171Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01291","last_updated":"2024-06-18T07:09:55Z","snapshot_observed_at":"2026-07-06T17:54:07.815827Z","submitted_at":"2024-04-01T17:58:06Z","title":"Evaluating Text-to-Visual Generation with Image-to-Text Generation","version":2},"cited_work":{"arxiv_id":"2404.01291","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.01291","snapshot_observed_at":"2026-07-08T05:54:33.534825Z","title":"Evaluating text-to-visual generation with image-to-text models.preprint","venue":"cs.CV","work_id":"f52d17a0-d6dd-4514-beb8-49201dfe0e89","year":2024},"citing_paper":{"arxiv_id":"2605.22996","last_updated":"2026-05-21T19:51:20Z","snapshot_observed_at":"2026-08-02T14:22:11.396159Z","submitted_at":"2026-05-21T19:51:20Z","title":"CoMoGen: COntrollable MOtion Dynamics and Interactions with Mask-Guided Video GENeration","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-25T05:44:58.627525Z"},"links":{"cited_paper":"/paper/2404.01291","citing_paper":"/paper/2605.22996"},"observation_digest":"sha256:b3407174cef1252c27d7a2b9d0dc0e71fde13b76023712a212739f872c64a315","observation_id":"deae0353-38df-47b4-be9b-7786fa88ebb8","resolution":{"observed_at":"2026-05-25T05:45:23.595429Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01291","last_updated":"2024-06-18T07:09:55Z","snapshot_observed_at":"2026-07-06T17:54:07.815827Z","submitted_at":"2024-04-01T17:58:06Z","title":"Evaluating Text-to-Visual Generation with Image-to-Text Generation","version":2},"cited_work":{"arxiv_id":"2404.01291","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.01291","snapshot_observed_at":"2026-07-08T05:54:33.534825Z","title":"Evaluating text-to-visual generation with image-to-text models.preprint","venue":"cs.CV","work_id":"f52d17a0-d6dd-4514-beb8-49201dfe0e89","year":2024},"citing_paper":{"arxiv_id":"2606.01803","last_updated":"2026-06-01T07:21:01Z","snapshot_observed_at":"2026-07-06T23:42:16.661228Z","submitted_at":"2026-06-01T07:21:01Z","title":"OctoT2I: A Self-Evolving Agentic Text-to-Image Router","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-28T14:22:57.822123Z"},"links":{"cited_paper":"/paper/2404.01291","citing_paper":"/paper/2606.01803"},"observation_digest":"sha256:5df8ce30ef4af8862e381b172730ee5d5c316b7a1524061a670f4c33cb7d7b60","observation_id":"0703f8fc-ca3f-4759-8fba-3b45f87205d4","resolution":{"observed_at":"2026-07-01T23:26:22.511477Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01291","last_updated":"2024-06-18T07:09:55Z","snapshot_observed_at":"2026-07-06T17:54:07.815827Z","submitted_at":"2024-04-01T17:58:06Z","title":"Evaluating Text-to-Visual Generation with Image-to-Text Generation","version":2},"cited_work":{"arxiv_id":"2404.01291","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.01291","snapshot_observed_at":"2026-07-08T05:54:33.534825Z","title":"Evaluating text-to-visual generation with image-to-text models.preprint","venue":"cs.CV","work_id":"f52d17a0-d6dd-4514-beb8-49201dfe0e89","year":2024},"citing_paper":{"arxiv_id":"2606.02521","last_updated":"2026-06-03T15:46:57Z","snapshot_observed_at":"2026-08-07T21:06:09.183177Z","submitted_at":"2026-06-01T17:31:49Z","title":"Drifting Preference Optimization for One-Step Generative Models","version":3},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-06-28T15:20:00.341773Z"},"links":{"cited_paper":"/paper/2404.01291","citing_paper":"/paper/2606.02521"},"observation_digest":"sha256:cb82d822ca30a3c78c4f047e8029ff9712a1d9f4d0efc3267dae179e8cd0d49f","observation_id":"78283488-ab90-42ba-84cb-6e676fe9e416","resolution":{"observed_at":"2026-07-01T22:36:16.554631Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01291","last_updated":"2024-06-18T07:09:55Z","snapshot_observed_at":"2026-07-06T17:54:07.815827Z","submitted_at":"2024-04-01T17:58:06Z","title":"Evaluating Text-to-Visual Generation with Image-to-Text Generation","version":2},"cited_work":{"arxiv_id":"2404.01291","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.01291","snapshot_observed_at":"2026-07-08T05:54:33.534825Z","title":"Evaluating text-to-visual generation with image-to-text models.preprint","venue":"cs.CV","work_id":"f52d17a0-d6dd-4514-beb8-49201dfe0e89","year":2024},"citing_paper":{"arxiv_id":"2606.05268","last_updated":"2026-06-03T16:50:49Z","snapshot_observed_at":"2026-08-06T15:59:52.458614Z","submitted_at":"2026-06-03T16:50:49Z","title":"Aggregating LLM-Based Weak Verifiers for Spatial Layout Generation","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-06-28T03:11:18.416545Z"},"links":{"cited_paper":"/paper/2404.01291","citing_paper":"/paper/2606.05268"},"observation_digest":"sha256:533dbf152ebcc0a7550c0ddcd713872d5fa0e4c51b14b9904b0641353f305850","observation_id":"402ab300-422d-4360-b0b4-3566229a7903","resolution":{"observed_at":"2026-07-02T11:36:55.559355Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01291","last_updated":"2024-06-18T07:09:55Z","snapshot_observed_at":"2026-07-06T17:54:07.815827Z","submitted_at":"2024-04-01T17:58:06Z","title":"Evaluating Text-to-Visual Generation with Image-to-Text Generation","version":2},"cited_work":{"arxiv_id":"2404.01291","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.01291","snapshot_observed_at":"2026-07-08T05:54:33.534825Z","title":"Evaluating text-to-visual generation with image-to-text models.preprint","venue":"cs.CV","work_id":"f52d17a0-d6dd-4514-beb8-49201dfe0e89","year":2024},"citing_paper":{"arxiv_id":"2606.09076","last_updated":"2026-07-14T12:46:55Z","snapshot_observed_at":"2026-07-17T23:19:03.633221Z","submitted_at":"2026-06-08T06:20:12Z","title":"Z-Reward: Beyond Scalar Rewards by Internalizing Reasoning into Score Distributions","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-27T17:30:57.001021Z"},"links":{"cited_paper":"/paper/2404.01291","citing_paper":"/paper/2606.09076"},"observation_digest":"sha256:fed50fe6036206ab66ff579d7bf8dc34c8dc178c3b39866eb6461b287b99b7d9","observation_id":"b28c1deb-60bd-412f-aded-8a884883f08e","resolution":{"observed_at":"2026-07-03T00:07:27.975927Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01291","last_updated":"2024-06-18T07:09:55Z","snapshot_observed_at":"2026-07-06T17:54:07.815827Z","submitted_at":"2024-04-01T17:58:06Z","title":"Evaluating Text-to-Visual Generation with Image-to-Text Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01291","snapshot_observed_at":"2026-07-15T10:53:37.186361Z","title":"org/abs/2404.01291","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.09076","last_updated":"2026-07-14T12:46:55Z","snapshot_observed_at":"2026-07-17T23:19:03.633221Z","submitted_at":"2026-06-08T06:20:12Z","title":"Z-Reward: Beyond Scalar Rewards by Internalizing Reasoning into Score Distributions","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-15T10:53:37.186361Z"},"links":{"cited_paper":"/paper/2404.01291","citing_paper":"/paper/2606.09076"},"observation_digest":"sha256:6b197484ad05d8351d6b47ad7b82b06498d2d4d55be01b54d3f88e6f9690bebb","observation_id":"58db80f9-b654-423c-876f-d2abe913eee2","resolution":{"observed_at":"2026-07-15T10:53:37.186361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01291","last_updated":"2024-06-18T07:09:55Z","snapshot_observed_at":"2026-07-06T17:54:07.815827Z","submitted_at":"2024-04-01T17:58:06Z","title":"Evaluating Text-to-Visual Generation with Image-to-Text Generation","version":2},"cited_work":{"arxiv_id":"2404.01291","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.01291","snapshot_observed_at":"2026-07-08T05:54:33.534825Z","title":"Evaluating text-to-visual generation with image-to-text models.preprint","venue":"cs.CV","work_id":"f52d17a0-d6dd-4514-beb8-49201dfe0e89","year":2024},"citing_paper":{"arxiv_id":"2606.27537","last_updated":"2026-07-19T21:49:02Z","snapshot_observed_at":"2026-08-05T10:16:29.451498Z","submitted_at":"2026-06-25T20:37:39Z","title":"MemoBench: Benchmarking World Modeling in Dynamically Changing Environments","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-29T02:03:45.564122Z"},"links":{"cited_paper":"/paper/2404.01291","citing_paper":"/paper/2606.27537"},"observation_digest":"sha256:2ce2e77e782d9bb6684e4c4d3171a8e72b24b7991b044efbb754b4d555952cd3","observation_id":"a9ba6b3d-2670-41f1-a467-67172dc8d38e","resolution":{"observed_at":"2026-07-01T18:25:57.825432Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01291","last_updated":"2024-06-18T07:09:55Z","snapshot_observed_at":"2026-07-06T17:54:07.815827Z","submitted_at":"2024-04-01T17:58:06Z","title":"Evaluating Text-to-Visual Generation with Image-to-Text Generation","version":2},"cited_work":{"arxiv_id":"2404.01291","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.01291","snapshot_observed_at":"2026-07-08T05:54:33.534825Z","title":"Evaluating text-to-visual generation with image-to-text models.preprint","venue":"cs.CV","work_id":"f52d17a0-d6dd-4514-beb8-49201dfe0e89","year":2024},"citing_paper":{"arxiv_id":"2606.27537","last_updated":"2026-07-19T21:49:02Z","snapshot_observed_at":"2026-08-05T10:16:29.451498Z","submitted_at":"2026-06-25T20:37:39Z","title":"MemoBench: Benchmarking World Modeling in Dynamically Changing Environments","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-01T06:25:58.872140Z"},"links":{"cited_paper":"/paper/2404.01291","citing_paper":"/paper/2606.27537"},"observation_digest":"sha256:dd0e3c2446889557ff840c2c88c0ea6660e85337695b0fafe60ad91addda7f30","observation_id":"a49818c1-a1da-4c19-9e60-7f3ea8b127af","resolution":{"observed_at":"2026-07-01T09:35:40.661088Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01291","last_updated":"2024-06-18T07:09:55Z","snapshot_observed_at":"2026-07-06T17:54:07.815827Z","submitted_at":"2024-04-01T17:58:06Z","title":"Evaluating Text-to-Visual Generation with Image-to-Text Generation","version":2},"cited_work":{"arxiv_id":"2404.01291","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.01291","snapshot_observed_at":"2026-07-08T05:54:33.534825Z","title":"Evaluating text-to-visual generation with image-to-text models.preprint","venue":"cs.CV","work_id":"f52d17a0-d6dd-4514-beb8-49201dfe0e89","year":2024},"citing_paper":{"arxiv_id":"2606.27537","last_updated":"2026-07-19T21:49:02Z","snapshot_observed_at":"2026-08-05T10:16:29.451498Z","submitted_at":"2026-06-25T20:37:39Z","title":"MemoBench: Benchmarking World Modeling in Dynamically Changing Environments","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-02T20:52:28.444524Z"},"links":{"cited_paper":"/paper/2404.01291","citing_paper":"/paper/2606.27537"},"observation_digest":"sha256:8e0437fa38f01ebd68a0eb5d0ebacd78e157f4fce9fb9c6d4a48c3d10cdcc5b2","observation_id":"84bc719c-7b65-4e39-a14b-8bf0d68da4b5","resolution":{"observed_at":"2026-07-02T20:57:22.814090Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01291","last_updated":"2024-06-18T07:09:55Z","snapshot_observed_at":"2026-07-06T17:54:07.815827Z","submitted_at":"2024-04-01T17:58:06Z","title":"Evaluating Text-to-Visual Generation with Image-to-Text Generation","version":2},"cited_work":{"arxiv_id":"2404.01291","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.01291","snapshot_observed_at":"2026-07-08T05:54:33.534825Z","title":"Evaluating text-to-visual generation with image-to-text models.preprint","venue":"cs.CV","work_id":"f52d17a0-d6dd-4514-beb8-49201dfe0e89","year":2024},"citing_paper":{"arxiv_id":"2606.27537","last_updated":"2026-07-19T21:49:02Z","snapshot_observed_at":"2026-08-05T10:16:29.451498Z","submitted_at":"2026-06-25T20:37:39Z","title":"MemoBench: Benchmarking World Modeling in Dynamically Changing Environments","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-03T22:44:16.272541Z"},"links":{"cited_paper":"/paper/2404.01291","citing_paper":"/paper/2606.27537"},"observation_digest":"sha256:6baddbf507febe9cddf1b9f021159e94eeb818b36e7778ca3f50d7429737db36","observation_id":"e713bdb3-097c-42a3-9755-f167132cdfa1","resolution":{"observed_at":"2026-07-03T22:49:00.907109Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01291","last_updated":"2024-06-18T07:09:55Z","snapshot_observed_at":"2026-07-06T17:54:07.815827Z","submitted_at":"2024-04-01T17:58:06Z","title":"Evaluating Text-to-Visual Generation with Image-to-Text Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01291","snapshot_observed_at":"2026-07-14T17:14:19.770867Z","title":"arXiv preprint arXiv:2404.01291 (2024) 8","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.27537","last_updated":"2026-07-19T21:49:02Z","snapshot_observed_at":"2026-08-05T10:16:29.451498Z","submitted_at":"2026-06-25T20:37:39Z","title":"MemoBench: Benchmarking World Modeling in Dynamically Changing Environments","version":5},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-14T17:14:19.770867Z"},"links":{"cited_paper":"/paper/2404.01291","citing_paper":"/paper/2606.27537"},"observation_digest":"sha256:38e57ae2614f72d24ca129a3e3085511f2b261444dcbd3021f29257100394911","observation_id":"44293852-cd35-4a06-bd9e-3516eb7cdeaa","resolution":{"observed_at":"2026-07-14T17:14:19.770867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01291","last_updated":"2024-06-18T07:09:55Z","snapshot_observed_at":"2026-07-06T17:54:07.815827Z","submitted_at":"2024-04-01T17:58:06Z","title":"Evaluating Text-to-Visual Generation with Image-to-Text Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01291","snapshot_observed_at":"2026-08-02T10:00:11.935029Z","title":"arXiv preprint arXiv:2404.01291 (2024) 8","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.27537","last_updated":"2026-07-19T21:49:02Z","snapshot_observed_at":"2026-08-05T10:16:29.451498Z","submitted_at":"2026-06-25T20:37:39Z","title":"MemoBench: Benchmarking World Modeling in Dynamically Changing Environments","version":6},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T10:00:11.935029Z"},"links":{"cited_paper":"/paper/2404.01291","citing_paper":"/paper/2606.27537"},"observation_digest":"sha256:b70cf46658a798e81ce9410479c865990b5620da6968cc476bb4f163c15d4782","observation_id":"885af771-e829-4bee-b993-0be55637f63f","resolution":{"observed_at":"2026-08-02T10:00:11.935029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01291","last_updated":"2024-06-18T07:09:55Z","snapshot_observed_at":"2026-07-06T17:54:07.815827Z","submitted_at":"2024-04-01T17:58:06Z","title":"Evaluating Text-to-Visual Generation with Image-to-Text Generation","version":2},"cited_work":{"arxiv_id":"2404.01291","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.01291","snapshot_observed_at":"2026-07-08T05:54:33.534825Z","title":"Evaluating text-to-visual generation with image-to-text models.preprint","venue":"cs.CV","work_id":"f52d17a0-d6dd-4514-beb8-49201dfe0e89","year":2024},"citing_paper":{"arxiv_id":"2607.06445","last_updated":"2026-07-07T16:11:13Z","snapshot_observed_at":"2026-08-07T18:51:57.165048Z","submitted_at":"2026-07-07T16:11:13Z","title":"Analysis-by-Proxy: Localization Signals in VLMs Operating as Condition Encoders","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-08T05:49:25.572256Z"},"links":{"cited_paper":"/paper/2404.01291","citing_paper":"/paper/2607.06445"},"observation_digest":"sha256:84a30d9ef83148b24c6414fb12b4679ccf4acb6706a63e0a8a4f16ddaefe0be9","observation_id":"36b15485-8046-4abd-9af9-931f173d5ae2","resolution":{"observed_at":"2026-07-08T05:54:33.536126Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01291","last_updated":"2024-06-18T07:09:55Z","snapshot_observed_at":"2026-07-06T17:54:07.815827Z","submitted_at":"2024-04-01T17:58:06Z","title":"Evaluating Text-to-Visual Generation with Image-to-Text Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01291","snapshot_observed_at":"2026-07-14T10:49:44.320793Z","title":"arXiv preprint arXiv:2404.01291 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10560","last_updated":"2026-07-14T14:49:20Z","snapshot_observed_at":"2026-08-06T14:02:29.848888Z","submitted_at":"2026-07-12T04:26:57Z","title":"PoseAlign: Sculpting Pose-Consistent Meshes via Text-Guided Deformation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-14T10:49:44.320793Z"},"links":{"cited_paper":"/paper/2404.01291","citing_paper":"/paper/2607.10560"},"observation_digest":"sha256:46b9fd3894d987e639e1264e03ebf8a83cc484185cc3bcf2b5bf9bb211357b62","observation_id":"72d22ed5-b880-49c3-82d2-6868f18c65ad","resolution":{"observed_at":"2026-07-14T10:49:44.320793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01291","last_updated":"2024-06-18T07:09:55Z","snapshot_observed_at":"2026-07-06T17:54:07.815827Z","submitted_at":"2024-04-01T17:58:06Z","title":"Evaluating Text-to-Visual Generation with Image-to-Text Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01291","snapshot_observed_at":"2026-08-01T10:59:55.585977Z","title":"Evaluating text-to-visual generation with image-to-text generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20048","last_updated":"2026-07-22T11:42:42Z","snapshot_observed_at":"2026-08-05T09:15:47.648858Z","submitted_at":"2026-07-22T11:42:42Z","title":"Importance-Aware OBS Pruning for Diffusion Models","version":1},"reference_index":113,"source":"pdf_text","source_observed_at":"2026-08-01T10:59:55.585977Z"},"links":{"cited_paper":"/paper/2404.01291","citing_paper":"/paper/2607.20048"},"observation_digest":"sha256:e4f16c4cfa580709f0d1f2c2a74405278959c2781bc126a9ca19a53147f05f32","observation_id":"938fa610-5582-41c0-bb9f-4b6442b8553a","resolution":{"observed_at":"2026-08-01T10:59:55.585977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2404.01291/citation-record","integrity":"/paper/2404.01291/integrity","json":"/paper/2404.01291/citation-record.json","paper":"/paper/2404.01291"},"outbound":[],"paper":{"arxiv_id":"2404.01291","last_updated":"2024-06-18T07:09:55Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T17:54:07.815827Z","submitted_at":"2024-04-01T17:58:06Z","title":"Evaluating Text-to-Visual Generation with Image-to-Text Generation"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 50 inbound Pith citation observations for arXiv:2404.01291."}