{"as_of":"2026-08-18T15:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1649a8a3a8150a30030d1bf4bba019ebcddcde33132be117f67a550f2fe3bc0b","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:28:35.910075Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T06:20:23.251121Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-16T04:39:08.655833Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18775","snapshot_observed_at":"2026-07-14T06:20:23.251121Z","title":"arXiv preprint arXiv:2505.18775 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11199","last_updated":"2026-07-13T07:50:54Z","snapshot_observed_at":"2026-08-15T06:39:04.122667Z","submitted_at":"2026-07-13T07:50:54Z","title":"DynEval: Holistic Evaluations of T2I Generative Models in the Wild","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-07-14T06:20:23.251121Z"},"links":{"cited_paper":"/paper/2505.18775","citing_paper":"/paper/2607.11199"},"observation_digest":"sha256:db991c251fa86d265a3ac9b0fd871edc4131c7da6bc17d087cd426bf503ab28e","observation_id":"48b59986-b7a8-4efd-af13-d8dadcaa1d7f","resolution":{"observed_at":"2026-07-14T06:20:23.251121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.18775/citation-record","integrity":"/paper/2505.18775/integrity","json":"/paper/2505.18775/citation-record.json","paper":"/paper/2505.18775"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-07T14:28:29.295573Z","title":"Qwen-vl: A versatile vision-language model for understanding, localization, text reading, and beyond.arXiv preprint arXiv:2308.12966, 1(2):3, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-16T04:39:08.655833Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:29.295573Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:5c760609d1cbdcf6c37be686fd4b2773436ae667ea57873435c35fc46cfae8f5","observation_id":"2512fa8f-a2f6-4ea6-9f2b-6a2892fe035a","resolution":{"observed_at":"2026-08-07T14:28:29.295573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:29.379140Z","title":"Imagen 3.arXiv preprint arXiv:2408.07009, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-16T04:39:08.655833Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:29.379140Z"},"links":{"citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:6e8a2336a1550b9fb4c23c1f32fa788125b7d4a76d7c12b69fd83c4d21951727","observation_id":"f6e0813d-039e-4e7f-80fd-c2c6b2173c73","resolution":{"observed_at":"2026-08-07T14:28:29.379140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:29.499025Z","title":"Improving image generation with better captions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-16T04:39:08.655833Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:29.499025Z"},"links":{"citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:d886b586f0890eba137b3a07cdfaf4468d66c6896b99449f58af73dc23c86ae6","observation_id":"179116bc-2e1c-49ee-8131-792ea8f7e260","resolution":{"observed_at":"2026-08-07T14:28:29.499025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:39.813801Z","title":"Flux1.1 [pro]: Advanced text-to-image generation","venue":null,"work_id":"e5e6d296-ea4b-41aa-aeec-76d6d590bbbe","year":2024},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-16T04:39:08.655833Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:29.643316Z"},"links":{"citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:6abc4c7aa47a6d848dd951a68f29b6cec82603e3471a5e0447ca8a8a509370e5","observation_id":"88bd8380-9655-4ca7-97f3-5f7781a19c9e","resolution":{"observed_at":"2026-08-07T14:28:39.968176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10563","last_updated":"2025-07-13T23:07:08Z","snapshot_observed_at":"2026-08-16T13:09:35.664885Z","submitted_at":"2024-10-14T14:42:12Z","title":"MEGA-Bench: Scaling Multimodal Evaluation to over 500 Real-World Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10563","snapshot_observed_at":"2026-08-07T14:28:29.775775Z","title":"Mega-bench: Scaling multimodal evaluation to over 500 real-world tasks.arXiv preprint arXiv:2410.10563, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-16T04:39:08.655833Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:29.775775Z"},"links":{"cited_paper":"/paper/2410.10563","citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:03dea4d063475dea0658a74e19f7dbad2fd0dcb81a565c2c3b162c4b5790a33b","observation_id":"eb001b3c-1e32-447c-aac6-58d4f013fa70","resolution":{"observed_at":"2026-08-07T14:28:29.775775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:29.862479Z","title":"Sharegpt4v: Improving large multi-modal models with better captions","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-16T04:39:08.655833Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:29.862479Z"},"links":{"citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:050d9330c2dcb50189ea6a682fc7e5b056528c4a43e765512eaa0aa794595f69","observation_id":"712b1f7f-f1af-46df-a7a3-38490e1ffeb1","resolution":{"observed_at":"2026-08-07T14:28:29.862479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:29.966648Z","title":"Generative pretraining from pixels","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-16T04:39:08.655833Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:29.966648Z"},"links":{"citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:e10f36751a5f4198ed85aa620f3854a9789a791a0d30a51436963ff5abe81713","observation_id":"bebc4b12-ae47-43ae-9f1b-29ab110dd5eb","resolution":{"observed_at":"2026-08-07T14:28:29.966648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-08-12T12:44:22.350068Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17811","snapshot_observed_at":"2026-08-07T14:28:30.097899Z","title":"Janus-pro: Unified multimodal understanding and generation with data and model scaling.arXiv preprint arXiv:2501.17811, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-16T04:39:08.655833Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:30.097899Z"},"links":{"cited_paper":"/paper/2501.17811","citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:33eeb027e645810b548336a64010d230159c68dd748301ad63c65f2f0bcd1ca1","observation_id":"63187bfa-1fb6-4de9-b6ee-a004f532a42e","resolution":{"observed_at":"2026-08-07T14:28:30.097899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:30.247323Z","title":"Masked-attention mask transformer for universal image segmentation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-16T04:39:08.655833Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:30.247323Z"},"links":{"citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:24cc5e0a559a33a85708ccd17883c4d4835c78c1b56b743867c49f410e901aa2","observation_id":"9abc236d-b12e-4359-a185-fc11a3faec6b","resolution":{"observed_at":"2026-08-07T14:28:30.247323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:30.340524Z","title":"Scaling rectified flow trans- formers for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-16T04:39:08.655833Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:30.340524Z"},"links":{"citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:f6a80deb446ed71fee9385ee9ad77f3814e4426975ad1adf4699da52bd5e734b","observation_id":"6c01f326-1404-4e65-922d-d127e347067b","resolution":{"observed_at":"2026-08-07T14:28:30.340524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13863","last_updated":"2024-10-17T17:59:59Z","snapshot_observed_at":"2026-08-16T13:08:17.144750Z","submitted_at":"2024-10-17T17:59:59Z","title":"Fluid: Scaling Autoregressive Text-to-image Generative Models with Continuous Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13863","snapshot_observed_at":"2026-08-07T14:28:30.474655Z","title":"Fluid: Scaling autoregressive text-to-image generative models with continuous tokens.arXiv preprint arXiv:2410.13863, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-16T04:39:08.655833Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:30.474655Z"},"links":{"cited_paper":"/paper/2410.13863","citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:1158b42d981f3c6b911c9c796bbcdc6477941db1effbc253ee8010b35266e74e","observation_id":"d9d632a7-038c-4a2c-a2be-6af5687e0ddf","resolution":{"observed_at":"2026-08-07T14:28:30.474655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11346","last_updated":"2025-06-28T11:46:35Z","snapshot_observed_at":"2026-08-16T15:39:15.923412Z","submitted_at":"2025-04-15T16:19:07Z","title":"Seedream 3.0 Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11346","snapshot_observed_at":"2026-08-07T14:28:30.598466Z","title":"Seedream 3.0 technical report.arXiv preprint arXiv:2504.11346, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-16T04:39:08.655833Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:30.598466Z"},"links":{"cited_paper":"/paper/2504.11346","citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:1362ce2911a1f0b450a22f9e404f21a2ab08a4c2dee393bd8fb43f2dbc7544a6","observation_id":"e3f06447-395a-44e2-a55a-601fe674da0a","resolution":{"observed_at":"2026-08-07T14:28:30.598466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:30.714121Z","title":"Geneval: An object-focused framework for evaluating text-to-image alignment.Advances in Neural Information Processing Systems, 36:52132–52152, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-16T04:39:08.655833Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:30.714121Z"},"links":{"citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:29b1e91fbc2e912682b374abe55edcf10f26905f6b818faab178c65028cc7142","observation_id":"24305e3b-7bc9-4c0f-9cf8-15318303a931","resolution":{"observed_at":"2026-08-07T14:28:30.714121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07703","last_updated":"2025-03-10T17:58:33Z","snapshot_observed_at":"2026-07-06T20:50:09.622181Z","submitted_at":"2025-03-10T17:58:33Z","title":"Seedream 2.0: A Native Chinese-English Bilingual Image Generation Foundation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07703","snapshot_observed_at":"2026-08-07T14:28:30.836749Z","title":"Seedream 2.0: A native chinese-english bilingual image generation foundation model.arXiv preprint arXiv:2503.07703, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-16T04:39:08.655833Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:30.836749Z"},"links":{"cited_paper":"/paper/2503.07703","citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:3e3ce8031c1c2ab90616db2b07cb9ab226dcf5a15c970062c8213b0a12224f56","observation_id":"1e6a4cd8-c0b9-4963-aa02-5f61e9f6963b","resolution":{"observed_at":"2026-08-07T14:28:30.836749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15594","last_updated":"2025-10-19T10:32:43Z","snapshot_observed_at":"2026-08-13T06:43:22.011336Z","submitted_at":"2024-11-23T16:03:35Z","title":"A Survey on LLM-as-a-Judge","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15594","snapshot_observed_at":"2026-08-07T14:28:30.975516Z","title":"A survey on llm-as-a-judge.arXiv preprint arXiv:2411.15594, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-16T04:39:08.655833Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:30.975516Z"},"links":{"cited_paper":"/paper/2411.15594","citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:e2aac739c00f44164d76eb6ddcd1a9ea2150c2e2aa97777465e6ca07bb8e3e6c","observation_id":"05ffd836-af89-4d16-8e44-e5d21617f6f4","resolution":{"observed_at":"2026-08-07T14:28:30.975516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04431","last_updated":"2025-06-17T15:32:20Z","snapshot_observed_at":"2026-08-15T00:31:45.808844Z","submitted_at":"2024-12-05T18:53:02Z","title":"Infinity: Scaling Bitwise AutoRegressive Modeling for High-Resolution Image Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04431","snapshot_observed_at":"2026-08-07T14:28:31.134652Z","title":"Infinity: Scaling bitwise autoregressive modeling for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-16T04:39:08.655833Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:31.134652Z"},"links":{"cited_paper":"/paper/2412.04431","citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:c10f3b491b40be977aab7174e2b5a6fef3d2845c034feae47dff99336faad96a","observation_id":"fc6ded08-f408-4eef-8c1f-0c5c1d5208bd","resolution":{"observed_at":"2026-08-07T14:28:31.134652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:31.273550Z","title":"Denoising diffusion probabilistic models.Advances in neural information processing systems, 33:6840–6851, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-16T04:39:08.655833Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:31.273550Z"},"links":{"citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:28020bf6328e87667486c09844db08abb9e8ba9e94f2c53ea9c18e65d013357a","observation_id":"70ed4d08-6ea5-4948-9ce0-6d53d9451b3e","resolution":{"observed_at":"2026-08-07T14:28:31.273550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05135","last_updated":"2024-03-08T08:08:10Z","snapshot_observed_at":"2026-08-12T17:58:56.652054Z","submitted_at":"2024-03-08T08:08:10Z","title":"ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05135","snapshot_observed_at":"2026-08-07T14:28:31.438907Z","title":"Ella: Equip diffusion models with llm for enhanced semantic alignment.arXiv preprint arXiv:2403.05135, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-16T04:39:08.655833Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:31.438907Z"},"links":{"cited_paper":"/paper/2403.05135","citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:9e8d699a4ba0c92e0c0c393b2095af1ae6caea1b9dff7a6ddafc72fef1a127b4","observation_id":"6d3fe910-e3b0-401a-bd17-e17bd1c3a99a","resolution":{"observed_at":"2026-08-07T14:28:31.438907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:31.562874Z","title":"T2i-compbench: A compre- hensive benchmark for open-world compositional text-to-image generation.Advances in Neural Information Processing Systems, 36:78723–78747, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-16T04:39:08.655833Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:31.562874Z"},"links":{"citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:bf1d604f85ae6d2a8782fe5579779858fbdb84dc7da1cf2298f0622af8b0e181","observation_id":"a2854d20-f825-4e38-bc92-45ea16fa310f","resolution":{"observed_at":"2026-08-07T14:28:31.562874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:31.688400Z","title":"T2i- compbench++: An enhanced and comprehensive benchmark for compositional text-to-image generation.IEEE Transactions on Pattern Analysis and Machine Intelligence, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-16T04:39:08.655833Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:31.688400Z"},"links":{"citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:3eaa3dcc6befec892625b8a2bb497164bbe2d4010c9ac2d82ca55bf638941601","observation_id":"daf5c128-881e-4efd-9b69-77e9116fa03a","resolution":{"observed_at":"2026-08-07T14:28:31.688400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:31.826848Z","title":"Smartedit: Exploring complex instruction- based image editing with multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-16T04:39:08.655833Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:31.826848Z"},"links":{"citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:10dda01a0472a41f60506b7822ad866b228e092bb1493ad4a79f91313f8630bb","observation_id":"b6a52180-e130-484d-94d7-9b39f21ac75a","resolution":{"observed_at":"2026-08-07T14:28:31.826848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T14:28:31.979482Z","title":"Gpt-4o system card.arXiv preprint arXiv:2410.21276, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-16T04:39:08.655833Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:31.979482Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:69a2e2e4a15ca2e872eabe49e171ee74e9791093d5070ca882e2a6f5235fd4f0","observation_id":"94ac27b8-8da2-4c73-a953-55a3758adeb6","resolution":{"observed_at":"2026-08-07T14:28:31.979482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07304","last_updated":"2024-05-28T12:32:31Z","snapshot_observed_at":"2026-08-16T14:10:44.156939Z","submitted_at":"2024-03-12T04:13:45Z","title":"Lumen: Unleashing Versatile Vision-Centric Capabilities of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07304","snapshot_observed_at":"2026-08-07T14:28:32.109779Z","title":"Lumen: Unleashing versatile vision-centric capabilities of large multimodal models.arXiv preprint arXiv:2403.07304, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-16T04:39:08.655833Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:32.109779Z"},"links":{"cited_paper":"/paper/2403.07304","citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:e2a5ff089bd757e5cc2882f38a60d9512bf60c4b97257bdf8b2b96c8a5d1be3e","observation_id":"80f0a40a-cea9-4987-898d-36caa0d6a161","resolution":{"observed_at":"2026-08-07T14:28:32.109779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04423","last_updated":"2025-04-06T09:20:49Z","snapshot_observed_at":"2026-08-16T12:43:38.601374Z","submitted_at":"2025-04-06T09:20:49Z","title":"UniToken: Harmonizing Multimodal Understanding and Generation through Unified Visual Encoding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.04423","snapshot_observed_at":"2026-08-07T14:28:32.219643Z","title":"Unitoken: Harmonizing multimodal understanding and generation through unified visual encoding.arXiv preprint arXiv:2504.04423, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-16T04:39:08.655833Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:32.219643Z"},"links":{"cited_paper":"/paper/2504.04423","citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:61acd2d320e3117d701a7395aa8850c464e2d91e5f6dab953791ad9f1347da39","observation_id":"1ed1e2e4-6fd9-447c-89d2-e5d3ad74bb88","resolution":{"observed_at":"2026-08-07T14:28:32.219643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00289","last_updated":"2025-04-01T19:09:34Z","snapshot_observed_at":"2026-08-17T01:12:01.354637Z","submitted_at":"2024-12-31T05:49:00Z","title":"Dual Diffusion for Unified Image Generation and Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00289","snapshot_observed_at":"2026-08-07T14:28:32.362554Z","title":"Dual diffusion for unified image generation and understanding.arXiv preprint arXiv:2501.00289, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-16T04:39:08.655833Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:32.362554Z"},"links":{"cited_paper":"/paper/2501.00289","citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:a655d4e5c65c2b78a363a9df833d1b1c075d41824dc91784526ff0e30daef552","observation_id":"ed0f780d-9212-47a9-96ab-f8b587539ce6","resolution":{"observed_at":"2026-08-07T14:28:32.362554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:32.471522Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-16T04:39:08.655833Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:32.471522Z"},"links":{"citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:3aeca749969cd478e1e748d1c9a3479abc43b34bded61a91b8d4748d876672e1","observation_id":"bce7c79f-86a0-48a6-8648-9ad7572829c4","resolution":{"observed_at":"2026-08-07T14:28:32.471522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.17761","last_updated":"2025-07-31T05:05:45Z","snapshot_observed_at":"2026-08-15T10:26:22.896514Z","submitted_at":"2025-04-24T17:25:12Z","title":"Step1X-Edit: A Practical Framework for General Image Editing","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.17761","snapshot_observed_at":"2026-08-07T14:28:32.610635Z","title":"Step1x-edit: A practical framework for general image editing.arXiv preprint arXiv:2504.17761, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-16T04:39:08.655833Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:32.610635Z"},"links":{"cited_paper":"/paper/2504.17761","citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:4809d4f37e91991f2067d8c6cc3e9068a2c4b53eb043090afbe2fa908fa8c543","observation_id":"93558a59-6c40-4f89-af10-36509eedaf50","resolution":{"observed_at":"2026-08-07T14:28:32.610635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10741","last_updated":"2022-03-08T18:18:49Z","snapshot_observed_at":"2026-08-07T12:21:17.790675Z","submitted_at":"2021-12-20T18:42:55Z","title":"GLIDE: Towards Photorealistic Image Generation and Editing with Text-Guided Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10741","snapshot_observed_at":"2026-08-07T14:28:32.759400Z","title":"Glide: Towards photorealistic image generation and editing with text-guided diffusion models.arXiv preprint arXiv:2112.10741, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-16T04:39:08.655833Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:32.759400Z"},"links":{"cited_paper":"/paper/2112.10741","citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:cccd964a82b072f8c25ca9cf829c0daba6312ad7e0c1197874ca4bd3b2a51ee7","observation_id":"667db9b1-f805-456d-aa65-246b61de0ce7","resolution":{"observed_at":"2026-08-07T14:28:32.759400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07265","last_updated":"2026-06-02T17:11:50Z","snapshot_observed_at":"2026-08-16T12:51:32.079370Z","submitted_at":"2025-03-10T12:47:53Z","title":"WISE: A World Knowledge-Informed Semantic Evaluation for Text-to-Image Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07265","snapshot_observed_at":"2026-08-07T14:28:32.849110Z","title":"Wise: A world knowledge-informed semantic evaluation for text-to-image generation.arXiv preprint arXiv:2503.07265, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-16T04:39:08.655833Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:32.849110Z"},"links":{"cited_paper":"/paper/2503.07265","citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:919378c1bc5383426ca414ec730f5cc820b61365cc9dca420bc27827b10cae10","observation_id":"06f51c28-4492-43fe-9042-a032154cb4fd","resolution":{"observed_at":"2026-08-07T14:28:32.849110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16855","last_updated":"2025-03-09T02:57:28Z","snapshot_observed_at":"2026-08-18T10:59:53.317746Z","submitted_at":"2024-06-24T17:58:47Z","title":"DreamBench++: A Human-Aligned Benchmark for Personalized Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16855","snapshot_observed_at":"2026-08-07T14:28:32.994290Z","title":"Dreambench++: A human-aligned benchmark for personalized image generation.arXiv preprint arXiv:2406.16855, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-16T04:39:08.655833Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:32.994290Z"},"links":{"cited_paper":"/paper/2406.16855","citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:7972055fb2e5a0d1d2268c77ff259fbda96002fd351d833efcf04ab1839f04d7","observation_id":"baf26363-2df5-4671-90d6-3c95ed69a624","resolution":{"observed_at":"2026-08-07T14:28:32.994290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-08-14T22:54:08.184266Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-07T14:28:33.100754Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis.arXiv preprint arXiv:2307.01952, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-16T04:39:08.655833Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:33.100754Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:1427654a5fff9b7b3562a96513d31ad4b7064d88bcdeb1f44ef547916c00cd27","observation_id":"8aa4a257-6577-433d-8c6f-dd02bf34176c","resolution":{"observed_at":"2026-08-07T14:28:33.100754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-08-15T12:50:58.405488Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-07T14:28:33.219203Z","title":"Hierarchical text-conditional image generation with clip latents.arXiv preprint arXiv:2204.06125, 1(2):3, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-16T04:39:08.655833Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:33.219203Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:51a37a72daccb1b3a1b213a34e27ab37a6a32ce81b0fbc985c9b29c68dc3bc17","observation_id":"b4ae9d06-9360-4d33-9bac-db1ffda71c76","resolution":{"observed_at":"2026-08-07T14:28:33.219203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:33.330159Z","title":"Vision transformers for dense prediction","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-16T04:39:08.655833Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:33.330159Z"},"links":{"citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:ceb5f140b4b6c63781852e6bc1f2a529f32490843d95739035c86e0e05e17e08","observation_id":"397e652e-4ba8-4f4a-af64-7e0d7ecd08e5","resolution":{"observed_at":"2026-08-07T14:28:33.330159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:33.455366Z","title":"High- resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-16T04:39:08.655833Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:33.455366Z"},"links":{"citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:45f93409d5104abd846757c9f2069eedff1b243b457c5780fed707210cf1b0a4","observation_id":"401de1fb-3ba7-4581-8f08-5d5685eac118","resolution":{"observed_at":"2026-08-07T14:28:33.455366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:33.607650Z","title":"Photorealistic text-to-image diffusion models with deep language understanding.Advances in neural information processing systems, 35:36479–36494, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-16T04:39:08.655833Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:33.607650Z"},"links":{"citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:16141b0441d309f07e3ef1bd31a2115cdae48e8cd79d45bc0f531ef2f2076fed","observation_id":"d492a396-8d58-4e14-b5af-9dae847c1e83","resolution":{"observed_at":"2026-08-07T14:28:33.607650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-08-11T15:38:14.931716Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-07T14:28:33.734038Z","title":"Denoising diffusion implicit models.arXiv preprint arXiv:2010.02502, 2020","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-16T04:39:08.655833Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:33.734038Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:3ee230b4b0df574fa092b54153e1a819ee1d22056e2298ba8ee5c0fe92d378bc","observation_id":"11ba40ed-a0f1-4214-9cc5-1ad67dd44a15","resolution":{"observed_at":"2026-08-07T14:28:33.734038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06525","last_updated":"2024-06-10T17:59:52Z","snapshot_observed_at":"2026-08-13T22:05:34.844117Z","submitted_at":"2024-06-10T17:59:52Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06525","snapshot_observed_at":"2026-08-07T14:28:33.846760Z","title":"Autoregressive model beats diffusion: Llama for scalable image generation.arXiv preprint arXiv:2406.06525, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-16T04:39:08.655833Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:33.846760Z"},"links":{"cited_paper":"/paper/2406.06525","citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:bc992637719a4c92e47be3447ed4caef4026c0b80cca497ac0d4afe60fab6e5c","observation_id":"f1d56689-5926-4aaa-8edb-b141979cd266","resolution":{"observed_at":"2026-08-07T14:28:33.846760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T14:28:33.967796Z","title":"Gemini: a family of highly capable multimodal models.arXiv preprint arXiv:2312.11805, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-16T04:39:08.655833Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:33.967796Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:5466413b1e6dd3ff5d45ef3c471ec5f206a0a4cc29e9e1fd9b7a371b2bd4035a","observation_id":"f21b04f6-5b96-4314-8a25-8a21085d8016","resolution":{"observed_at":"2026-08-07T14:28:33.967796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:34.088359Z","title":"Visual autoregressive modeling: Scalable image generation via next-scale prediction.Advances in neural information processing systems, 37:84839–84865, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-16T04:39:08.655833Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:34.088359Z"},"links":{"citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:b37055907f90be1fca6fb0bf3923455a24baa00b7b6248d12ffd5146f16a2e4d","observation_id":"2dd0c276-3f5e-4b66-b540-53865d3e78f8","resolution":{"observed_at":"2026-08-07T14:28:34.088359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:39.361056Z","title":"Evolving storytelling: benchmarks and methods for new character customization with diffusion models","venue":null,"work_id":"63229846-2abe-4b34-ab27-8fa2b9723287","year":2024},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-16T04:39:08.655833Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:34.237115Z"},"links":{"citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:985a71e46f3ce9ba011ee88d05f999fa0f8fd2cc96777c1da4e2ba58eb884e67","observation_id":"456f8880-6752-4e00-b4f6-19c803b0f578","resolution":{"observed_at":"2026-08-07T14:28:39.510080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14339","last_updated":"2024-08-26T15:08:12Z","snapshot_observed_at":"2026-08-16T13:23:47.424385Z","submitted_at":"2024-08-26T15:08:12Z","title":"ConceptMix: A Compositional Image Generation Benchmark with Controllable Difficulty","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.14339","snapshot_observed_at":"2026-08-07T14:28:34.389019Z","title":"Conceptmix: A compositional image generation benchmark with controllable difficulty.arXiv preprint arXiv:2408.14339, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-16T04:39:08.655833Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:34.389019Z"},"links":{"cited_paper":"/paper/2408.14339","citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:e63520f9f747f48137a28cc4e470086fab64b4e969a21b58b7a87dd6e7ed3e1c","observation_id":"6e6be51f-7718-48d4-a1bd-af3ae90e0e0d","resolution":{"observed_at":"2026-08-07T14:28:34.389019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-07T14:28:34.510211Z","title":"Show-o: One single trans- former to unify multimodal understanding and generation.arXiv preprint arXiv:2408.12528, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-16T04:39:08.655833Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:34.510211Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:74a2274645b3b543f32b02af3298aee4f265a0349023a93c4ee91d279343b23f","observation_id":"a3cc4fbb-c669-4e01-9bb8-015dd4de32ac","resolution":{"observed_at":"2026-08-07T14:28:34.510211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02826","last_updated":"2025-05-27T15:54:58Z","snapshot_observed_at":"2026-08-16T12:44:10.399972Z","submitted_at":"2025-04-03T17:59:56Z","title":"Envisioning Beyond the Pixels: Benchmarking Reasoning-Informed Visual Editing","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02826","snapshot_observed_at":"2026-08-07T14:28:34.643778Z","title":"Envisioning beyond the pixels: Benchmarking reasoning-informed visual editing.arXiv preprint arXiv:2504.02826, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-16T04:39:08.655833Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:34.643778Z"},"links":{"cited_paper":"/paper/2504.02826","citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:d43d4aa8bb0615ca08de98dd55d30109f27f0b2e8b97b34c7a57ad6d7e4958df","observation_id":"ac53e407-5d32-476e-be06-8d9d59866187","resolution":{"observed_at":"2026-08-07T14:28:34.643778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11039","last_updated":"2024-08-20T17:48:20Z","snapshot_observed_at":"2026-08-11T01:34:46.484513Z","submitted_at":"2024-08-20T17:48:20Z","title":"Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11039","snapshot_observed_at":"2026-08-07T14:28:34.753090Z","title":"Not applicable","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-16T04:39:08.655833Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:34.753090Z"},"links":{"cited_paper":"/paper/2408.11039","citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:806d96ec5e126826633d6373f0ac1a50a68fc9036b74ef181b07800a36789af8","observation_id":"654d0a23-4d51-4dd1-af7c-b6e468722408","resolution":{"observed_at":"2026-08-07T14:28:34.753090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:39.053252Z","title":null,"venue":null,"work_id":"0882cfbf-ade9-43c4-a49e-d7bfbb9fb977","year":null},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-16T04:39:08.655833Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:34.852853Z"},"links":{"citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:fe389e8372c9b063de3f91d60d28b99c1f097a2c53ba3ee999f3d25e59d883e1","observation_id":"c6373c3c-90d4-4ec1-974d-989a8e8216cc","resolution":{"observed_at":"2026-08-07T14:28:39.227501Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:38.804979Z","title":null,"venue":null,"work_id":"d0416992-d8b4-46e1-b05b-e18f00f5d629","year":null},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-16T04:39:08.655833Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:34.990939Z"},"links":{"citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:cecc1ac2d423ce34d802eded408e2810190b43c19a82e283ec6aa953445049d8","observation_id":"6866b88d-7c9b-4b7a-8f11-26dc576d2760","resolution":{"observed_at":"2026-08-07T14:28:38.939411Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:38.528714Z","title":null,"venue":null,"work_id":"16b93f3b-20aa-4a45-a63a-a2f389cecc38","year":null},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-16T04:39:08.655833Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:35.120612Z"},"links":{"citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:019f63db4feb1672e3c96ba7229d2c1c59c534f111cd3e93f4eb5b7e3591f9d1","observation_id":"995dda9f-06a7-4ec4-86bb-3003227a9ab5","resolution":{"observed_at":"2026-08-07T14:28:38.651186Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:38.261335Z","title":"Identify and highlight the inflection points of the function shown in the image","venue":null,"work_id":"9deee88d-e982-43c1-bf3b-e60d55d6e3a1","year":2020},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-16T04:39:08.655833Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:35.228438Z"},"links":{"citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:e9d166d76713dbe3be840a4a3e70459240176391e701a657c107aaa19df75283","observation_id":"7eb7d2d1-4e50-4cee-b487-844a53544732","resolution":{"observed_at":"2026-08-07T14:28:38.384268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:38.045601Z","title":null,"venue":null,"work_id":"fb5f05a6-36ef-4fa6-aebb-25627016da77","year":null},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-16T04:39:08.655833Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:35.282745Z"},"links":{"citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:c2ba4905b51c91bed71294a1926abc321f73668b8c56f4856d8f7b40baa7ad9e","observation_id":"19f2abe5-92fd-482d-8826-5cea8d6283fc","resolution":{"observed_at":"2026-08-07T14:28:38.181329Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:37.808357Z","title":null,"venue":null,"work_id":"ed8268f7-a46c-4038-9f5a-b9b0df728a63","year":null},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-16T04:39:08.655833Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:35.328745Z"},"links":{"citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:78cfffd2ba58efb2493dc4f3ae65ff216ad359e1210e08e7cdef1b5580aa8397","observation_id":"b2f7de11-125a-4e38-befb-34fe66d5be4f","resolution":{"observed_at":"2026-08-07T14:28:37.924467Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:37.588310Z","title":null,"venue":null,"work_id":"f067e0fc-e9d4-4714-8bcd-346a88131d37","year":null},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-16T04:39:08.655833Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:35.407601Z"},"links":{"citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:ee381ecee91ad2ebfcaf178ceebe139da3f685a78056981fee267e6dd8904f68","observation_id":"5c05967e-cc88-4f73-9e13-05459d9e11f2","resolution":{"observed_at":"2026-08-07T14:28:37.684805Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:37.381165Z","title":null,"venue":null,"work_id":"ce3b0089-e7d6-4510-bca0-e36ac12badce","year":null},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-16T04:39:08.655833Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:35.539559Z"},"links":{"citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:30c88622a1ff6142bb4c81bdc630be45b616e0c65f91eb19555e134f4df08869","observation_id":"5796b532-7688-4fc3-9891-78018bf62abf","resolution":{"observed_at":"2026-08-07T14:28:37.476868Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:37.161526Z","title":null,"venue":null,"work_id":"d704cda9-c1c1-4ad0-a690-7f06dce39818","year":null},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-16T04:39:08.655833Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:35.597984Z"},"links":{"citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:5cea0bddfe31d80bf0ff22b480860ece6715620a69a1f02b4a15910db2a7b212","observation_id":"863525e2-b1ab-4df1-86d5-2213272e20db","resolution":{"observed_at":"2026-08-07T14:28:37.265280Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:37.000971Z","title":null,"venue":null,"work_id":"983aeeae-0f55-43ad-af34-b1e3e8b00bfd","year":null},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-16T04:39:08.655833Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:35.670058Z"},"links":{"citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:e0205aa248aea8271ae691204f5422c38619bfd512b99ea7e227ddac05a470b7","observation_id":"256de426-fe25-4cd9-90ff-4ba675c46303","resolution":{"observed_at":"2026-08-07T14:28:37.071301Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:36.849347Z","title":null,"venue":null,"work_id":"6cd8244a-8d75-43ad-9db2-aebbb8c62868","year":null},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-16T04:39:08.655833Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:35.741444Z"},"links":{"citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:34eb7b439d7ee409c15f85bdb680c4a684faa999a025784f48eecf30a596ddba","observation_id":"78e3e01b-0a59-4d3a-ad4d-e1326fb76637","resolution":{"observed_at":"2026-08-07T14:28:36.886405Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:36.654461Z","title":null,"venue":null,"work_id":"46779a04-6543-4a4d-81ad-167e27a7f0d6","year":null},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-16T04:39:08.655833Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:35.805925Z"},"links":{"citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:39f6e303a751cd3d2a408dd49a0c0578a847cf2ec7d5c1f754fe5042d6be81b5","observation_id":"3376522a-1709-41b7-80e5-6fd3d9ec49d3","resolution":{"observed_at":"2026-08-07T14:28:36.744968Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:28:36.532661Z","title":"To Do Today","venue":null,"work_id":"e405cebf-71e3-4125-b668-646791c65f3f","year":null},"citing_paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","snapshot_observed_at":"2026-08-16T04:39:08.655833Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:35.910075Z"},"links":{"citing_paper":"/paper/2505.18775"},"observation_digest":"sha256:faed3c9f8d837dde78f661598f6c5e1c73cca9a8d10e3fe69dff4ed2bb3e5897","observation_id":"2b8b1568-7216-45b2-9073-2cffad60ef0b","resolution":{"observed_at":"2026-08-07T14:28:36.588956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.18775","last_updated":"2025-05-24T16:29:34Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T04:39:08.655833Z","submitted_at":"2025-05-24T16:29:34Z","title":"OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":53,"verified_exact":0,"verified_fuzzy":4},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 1 inbound Pith citation observation for arXiv:2505.18775."}