{"as_of":"2026-08-13T12:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7ee2b8d521ba48e3dc8b0c8414b7ca4450e1166a791e5b991a82a8f82c71c93f","coverage":[{"denominator":61,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":61,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:03:43.408265Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.16425/citation-record","integrity":"/paper/2505.16425/integrity","json":"/paper/2505.16425/citation-record.json","paper":"/paper/2505.16425"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:03:46.159828Z","title":null,"venue":null,"work_id":"1fc948c8-d41f-4a5d-b380-827f55efb02e","year":2023},"citing_paper":{"arxiv_id":"2505.16425","last_updated":"2025-05-22T09:10:09Z","snapshot_observed_at":"2026-08-09T16:14:10.026741Z","submitted_at":"2025-05-22T09:10:09Z","title":"$I^2G$: Generating Instructional Illustrations via Text-Conditioned Diffusion","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T15:03:35.493664Z"},"links":{"citing_paper":"/paper/2505.16425"},"observation_digest":"sha256:fd081f8e5e449358face6133296c93f8bd0ee1f7d87fe4d8edcd6cd4fc12a612","observation_id":"9bc41830-0ba5-4bc4-a162-293bc1e8b35c","resolution":{"observed_at":"2026-08-07T15:03:46.264468Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.00650","last_updated":"2022-05-13T14:41:49Z","snapshot_observed_at":"2026-08-08T03:25:09.401749Z","submitted_at":"2021-04-01T17:48:27Z","title":"Frozen in Time: A Joint Video and Image Encoder for End-to-End Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.00650","snapshot_observed_at":"2026-08-07T15:03:35.615548Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.16425","last_updated":"2025-05-22T09:10:09Z","snapshot_observed_at":"2026-08-09T16:14:10.026741Z","submitted_at":"2025-05-22T09:10:09Z","title":"$I^2G$: Generating Instructional Illustrations via Text-Conditioned Diffusion","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T15:03:35.615548Z"},"links":{"cited_paper":"/paper/2104.00650","citing_paper":"/paper/2505.16425"},"observation_digest":"sha256:ac043ecb79fba305ffe606e6c73f81352c2630630615ecc5d6536971e2339c3c","observation_id":"d3a93cff-b7ce-4f0b-b53a-36e1d7befe0e","resolution":{"observed_at":"2026-08-07T15:03:35.615548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05961","last_updated":"2024-08-21T22:46:05Z","snapshot_observed_at":"2026-08-13T00:34:33.528585Z","submitted_at":"2024-04-09T02:51:05Z","title":"LLM2Vec: Large Language Models Are Secretly Powerful Text Encoders","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05961","snapshot_observed_at":"2026-08-07T15:03:35.811186Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16425","last_updated":"2025-05-22T09:10:09Z","snapshot_observed_at":"2026-08-09T16:14:10.026741Z","submitted_at":"2025-05-22T09:10:09Z","title":"$I^2G$: Generating Instructional Illustrations via Text-Conditioned Diffusion","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T15:03:35.811186Z"},"links":{"cited_paper":"/paper/2404.05961","citing_paper":"/paper/2505.16425"},"observation_digest":"sha256:cc980a80094b7c4241d63cdcb8c8bcf64dda1ccd0ef9168c9135c45838ddb3e2","observation_id":"a4276df0-c917-4904-8060-67d8944eb415","resolution":{"observed_at":"2026-08-07T15:03:35.811186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:03:45.977236Z","title":"https://api.semanticscholar.org/CorpusID:264403242 Improving image generation with better captions","venue":null,"work_id":"83fbeac8-e20e-4472-976f-8de9c4c8eb93","year":null},"citing_paper":{"arxiv_id":"2505.16425","last_updated":"2025-05-22T09:10:09Z","snapshot_observed_at":"2026-08-09T16:14:10.026741Z","submitted_at":"2025-05-22T09:10:09Z","title":"$I^2G$: Generating Instructional Illustrations via Text-Conditioned Diffusion","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T15:03:35.945204Z"},"links":{"citing_paper":"/paper/2505.16425"},"observation_digest":"sha256:e4f8885f5608a72e1d4d30f89bccf017a21c7a7d01d5f8d305e434e02d5cc74a","observation_id":"76120329-8559-416c-9ba0-0a9d28055e15","resolution":{"observed_at":"2026-08-07T15:03:46.036153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13301","last_updated":"2024-01-04T19:11:25Z","snapshot_observed_at":"2026-08-09T16:20:23.732146Z","submitted_at":"2023-05-22T17:57:41Z","title":"Training Diffusion Models with Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13301","snapshot_observed_at":"2026-08-07T15:03:36.086633Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16425","last_updated":"2025-05-22T09:10:09Z","snapshot_observed_at":"2026-08-09T16:14:10.026741Z","submitted_at":"2025-05-22T09:10:09Z","title":"$I^2G$: Generating Instructional Illustrations via Text-Conditioned Diffusion","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T15:03:36.086633Z"},"links":{"cited_paper":"/paper/2305.13301","citing_paper":"/paper/2505.16425"},"observation_digest":"sha256:6795e0af3924fe005e6bbeafc82583aead6c5aabb8d14ed8b79c5ccf9db47481","observation_id":"55672839-4837-46ca-952e-2ce7a32bfd7e","resolution":{"observed_at":"2026-08-07T15:03:36.086633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04542","last_updated":"2025-05-30T15:09:49Z","snapshot_observed_at":"2026-08-13T11:22:30.419352Z","submitted_at":"2023-06-07T15:46:47Z","title":"On the Design Fundamentals of Diffusion Models: A Survey","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.04542","snapshot_observed_at":"2026-08-07T15:03:36.217850Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16425","last_updated":"2025-05-22T09:10:09Z","snapshot_observed_at":"2026-08-09T16:14:10.026741Z","submitted_at":"2025-05-22T09:10:09Z","title":"$I^2G$: Generating Instructional Illustrations via Text-Conditioned Diffusion","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T15:03:36.217850Z"},"links":{"cited_paper":"/paper/2306.04542","citing_paper":"/paper/2505.16425"},"observation_digest":"sha256:a5c60adf68c3eb170f72fa3b7bcea2ced30fef38d1c67783b67daa64a723e091","observation_id":"ff16a6bd-03ce-4f03-aa78-5b30b366f4a6","resolution":{"observed_at":"2026-08-07T15:03:36.217850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04788","last_updated":"2024-06-11T06:21:46Z","snapshot_observed_at":"2026-08-13T04:24:21.294496Z","submitted_at":"2024-02-07T12:28:32Z","title":"MLLM-as-a-Judge: Assessing Multimodal LLM-as-a-Judge with Vision-Language Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04788","snapshot_observed_at":"2026-08-07T15:03:36.345971Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16425","last_updated":"2025-05-22T09:10:09Z","snapshot_observed_at":"2026-08-09T16:14:10.026741Z","submitted_at":"2025-05-22T09:10:09Z","title":"$I^2G$: Generating Instructional Illustrations via Text-Conditioned Diffusion","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T15:03:36.345971Z"},"links":{"cited_paper":"/paper/2402.04788","citing_paper":"/paper/2505.16425"},"observation_digest":"sha256:202a6ee910fbe3a3d69dbb2af3dab043ba737a5cf700609e08fb6d34d5751885","observation_id":"b34f1779-4abc-4d04-83ea-91e003946f69","resolution":{"observed_at":"2026-08-07T15:03:36.345971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05125","last_updated":"2024-10-28T09:53:39Z","snapshot_observed_at":"2026-08-13T00:59:30.390642Z","submitted_at":"2024-03-08T07:41:47Z","title":"Evaluating Text-to-Image Generative Models: An Empirical Study on Human Image Synthesis","version":2},"cited_work":{"arxiv_id":"2403.05125","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.05125","snapshot_observed_at":"2026-08-07T15:03:45.569247Z","title":"Evaluating Text-to-Image Generative Models: An Empirical Study on Human Image Synthesis","venue":"cs.CV","work_id":"14d88602-1f82-429b-a960-a7de2f0013b5","year":2024},"citing_paper":{"arxiv_id":"2505.16425","last_updated":"2025-05-22T09:10:09Z","snapshot_observed_at":"2026-08-09T16:14:10.026741Z","submitted_at":"2025-05-22T09:10:09Z","title":"$I^2G$: Generating Instructional Illustrations via Text-Conditioned Diffusion","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T15:03:36.484830Z"},"links":{"cited_paper":"/paper/2403.05125","citing_paper":"/paper/2505.16425"},"observation_digest":"sha256:cf8a0ceaf1a21cfe6195c4d7259705212bf792ab06bbf251c8472616484bfcb4","observation_id":"54cb629c-fbd1-44d4-98b1-aac0a7fb722b","resolution":{"observed_at":"2026-08-07T15:03:45.649994Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10843","last_updated":"2023-05-26T02:01:54Z","snapshot_observed_at":"2026-08-13T11:39:37.064769Z","submitted_at":"2023-05-18T09:56:44Z","title":"X-IQE: eXplainable Image Quality Evaluation for Text-to-Image Generation with Visual Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10843","snapshot_observed_at":"2026-08-07T15:03:36.621699Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16425","last_updated":"2025-05-22T09:10:09Z","snapshot_observed_at":"2026-08-09T16:14:10.026741Z","submitted_at":"2025-05-22T09:10:09Z","title":"$I^2G$: Generating Instructional Illustrations via Text-Conditioned Diffusion","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T15:03:36.621699Z"},"links":{"cited_paper":"/paper/2305.10843","citing_paper":"/paper/2505.16425"},"observation_digest":"sha256:b2e4fd93572fa6c90453ba6d4a4eb8c81e40b03608047f7f32759495bde1ad00","observation_id":"9b4aefc5-8d71-4ab5-8f5c-9914c9948280","resolution":{"observed_at":"2026-08-07T15:03:36.621699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:03:36.759018Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16425","last_updated":"2025-05-22T09:10:09Z","snapshot_observed_at":"2026-08-09T16:14:10.026741Z","submitted_at":"2025-05-22T09:10:09Z","title":"$I^2G$: Generating Instructional Illustrations via Text-Conditioned Diffusion","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T15:03:36.759018Z"},"links":{"citing_paper":"/paper/2505.16425"},"observation_digest":"sha256:ace5bd25caf993ccb1acd9badd08293ac4eab714537295d500c06755443e5596","observation_id":"382f8147-2089-4b7a-b9ed-18b03b123820","resolution":{"observed_at":"2026-08-07T15:03:36.759018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17400","last_updated":"2024-06-21T16:45:11Z","snapshot_observed_at":"2026-08-06T10:08:54.816113Z","submitted_at":"2023-09-29T17:01:02Z","title":"Directly Fine-Tuning Diffusion Models on Differentiable Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17400","snapshot_observed_at":"2026-08-07T15:03:36.864834Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16425","last_updated":"2025-05-22T09:10:09Z","snapshot_observed_at":"2026-08-09T16:14:10.026741Z","submitted_at":"2025-05-22T09:10:09Z","title":"$I^2G$: Generating Instructional Illustrations via Text-Conditioned Diffusion","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T15:03:36.864834Z"},"links":{"cited_paper":"/paper/2309.17400","citing_paper":"/paper/2505.16425"},"observation_digest":"sha256:c162b66c012747ba0f64d6e781f069a15714a7018c33b6b826d1a42e898a7c9f","observation_id":"0edff757-7773-4372-b5d3-9a975d96818b","resolution":{"observed_at":"2026-08-07T15:03:36.864834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15807","last_updated":"2023-09-27T17:30:19Z","snapshot_observed_at":"2026-08-13T10:03:45.960823Z","submitted_at":"2023-09-27T17:30:19Z","title":"Emu: Enhancing Image Generation Models Using Photogenic Needles in a Haystack","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15807","snapshot_observed_at":"2026-08-07T15:03:36.999362Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16425","last_updated":"2025-05-22T09:10:09Z","snapshot_observed_at":"2026-08-09T16:14:10.026741Z","submitted_at":"2025-05-22T09:10:09Z","title":"$I^2G$: Generating Instructional Illustrations via Text-Conditioned Diffusion","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T15:03:36.999362Z"},"links":{"cited_paper":"/paper/2309.15807","citing_paper":"/paper/2505.16425"},"observation_digest":"sha256:1b3c3eddef689e30e2d24d6f08266e86aa768d4330b9e7962235dfb704289a4a","observation_id":"429222e7-86b9-484c-bfba-d965c4e25d92","resolution":{"observed_at":"2026-08-07T15:03:36.999362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06767","last_updated":"2023-12-01T14:28:06Z","snapshot_observed_at":"2026-08-07T04:02:54.504761Z","submitted_at":"2023-04-13T18:22:40Z","title":"RAFT: Reward rAnked FineTuning for Generative Foundation Model Alignment","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06767","snapshot_observed_at":"2026-08-07T15:03:37.111417Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16425","last_updated":"2025-05-22T09:10:09Z","snapshot_observed_at":"2026-08-09T16:14:10.026741Z","submitted_at":"2025-05-22T09:10:09Z","title":"$I^2G$: Generating Instructional Illustrations via Text-Conditioned Diffusion","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T15:03:37.111417Z"},"links":{"cited_paper":"/paper/2304.06767","citing_paper":"/paper/2505.16425"},"observation_digest":"sha256:c0ad4c14a5823b8fc5e34b099550ba66080121a662a3bf1dca0dc2b591a151a2","observation_id":"7e163a25-9377-4b98-83b3-5fe7ae6f4acd","resolution":{"observed_at":"2026-08-07T15:03:37.111417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16381","last_updated":"2023-11-01T04:48:26Z","snapshot_observed_at":"2026-08-13T11:33:10.908166Z","submitted_at":"2023-05-25T17:35:38Z","title":"DPOK: Reinforcement Learning for Fine-tuning Text-to-Image Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16381","snapshot_observed_at":"2026-08-07T15:03:37.181408Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16425","last_updated":"2025-05-22T09:10:09Z","snapshot_observed_at":"2026-08-09T16:14:10.026741Z","submitted_at":"2025-05-22T09:10:09Z","title":"$I^2G$: Generating Instructional Illustrations via Text-Conditioned Diffusion","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T15:03:37.181408Z"},"links":{"cited_paper":"/paper/2305.16381","citing_paper":"/paper/2505.16425"},"observation_digest":"sha256:e4729a479909a1826225964cd4d3f776a2c931d04179e81edd7ad3cfe5d23843","observation_id":"dda87e0e-175e-4c16-89a3-0cd24a0247a1","resolution":{"observed_at":"2026-08-07T15:03:37.181408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.03684","last_updated":"2020-08-12T03:21:27Z","snapshot_observed_at":"2026-08-10T13:31:48.487623Z","submitted_at":"2020-05-07T18:03:57Z","title":"Learning to Segment Actions from Observation and Narration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.03684","snapshot_observed_at":"2026-08-07T15:03:37.252800Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.16425","last_updated":"2025-05-22T09:10:09Z","snapshot_observed_at":"2026-08-09T16:14:10.026741Z","submitted_at":"2025-05-22T09:10:09Z","title":"$I^2G$: Generating Instructional Illustrations via Text-Conditioned Diffusion","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T15:03:37.252800Z"},"links":{"cited_paper":"/paper/2005.03684","citing_paper":"/paper/2505.16425"},"observation_digest":"sha256:19666194a4ee8d0c18ec5af570da98979e7cc39e7a4c053cbb9f31e642eb4e87","observation_id":"8fc889f0-a173-4fad-8d21-1e5a948403a1","resolution":{"observed_at":"2026-08-07T15:03:37.252800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.04166","last_updated":"2023-02-13T16:19:05Z","snapshot_observed_at":"2026-08-05T08:58:00.258106Z","submitted_at":"2023-02-08T16:17:29Z","title":"GPTScore: Evaluate as You Desire","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.04166","snapshot_observed_at":"2026-08-07T15:03:37.396043Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16425","last_updated":"2025-05-22T09:10:09Z","snapshot_observed_at":"2026-08-09T16:14:10.026741Z","submitted_at":"2025-05-22T09:10:09Z","title":"$I^2G$: Generating Instructional Illustrations via Text-Conditioned Diffusion","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T15:03:37.396043Z"},"links":{"cited_paper":"/paper/2302.04166","citing_paper":"/paper/2505.16425"},"observation_digest":"sha256:df1e9aa4ab12d6e0167d81cf859fc0e991a6f72d4eba5a0f078f591ed2e09a5b","observation_id":"6cf01b20-c326-470f-b85c-98df55b90754","resolution":{"observed_at":"2026-08-07T15:03:37.396043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01618","last_updated":"2022-08-02T17:50:36Z","snapshot_observed_at":"2026-08-02T23:40:32.342515Z","submitted_at":"2022-08-02T17:50:36Z","title":"An Image is Worth One Word: Personalizing Text-to-Image Generation using Textual Inversion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01618","snapshot_observed_at":"2026-08-07T15:03:37.532493Z","title":"Bermano, Gal Chechik, and Daniel Cohen-Or","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.16425","last_updated":"2025-05-22T09:10:09Z","snapshot_observed_at":"2026-08-09T16:14:10.026741Z","submitted_at":"2025-05-22T09:10:09Z","title":"$I^2G$: Generating Instructional Illustrations via Text-Conditioned Diffusion","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T15:03:37.532493Z"},"links":{"cited_paper":"/paper/2208.01618","citing_paper":"/paper/2505.16425"},"observation_digest":"sha256:457cbebc3e6518b2a0b145fea72738954df680fa6f36942261973ae2350ed10a","observation_id":"a9a1f61f-aa72-46a9-823b-aadd3484262d","resolution":{"observed_at":"2026-08-07T15:03:37.532493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.00597","last_updated":"2020-11-01T18:54:09Z","snapshot_observed_at":"2026-08-12T00:24:41.553563Z","submitted_at":"2020-11-01T18:54:09Z","title":"COOT: Cooperative Hierarchical Transformer for Video-Text Representation Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.00597","snapshot_observed_at":"2026-08-07T15:03:37.652640Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.16425","last_updated":"2025-05-22T09:10:09Z","snapshot_observed_at":"2026-08-09T16:14:10.026741Z","submitted_at":"2025-05-22T09:10:09Z","title":"$I^2G$: Generating Instructional Illustrations via Text-Conditioned Diffusion","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T15:03:37.652640Z"},"links":{"cited_paper":"/paper/2011.00597","citing_paper":"/paper/2505.16425"},"observation_digest":"sha256:b5b0c59d62b905bf8c7b2fb6db6a3cb05e328f90cea2742121a90a0b9af9cd0b","observation_id":"66908ad7-fc0f-4d95-9147-fc4620f8c7f4","resolution":{"observed_at":"2026-08-07T15:03:37.652640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02968","last_updated":"2022-04-06T17:59:46Z","snapshot_observed_at":"2026-08-09T15:43:28.147049Z","submitted_at":"2022-04-06T17:59:46Z","title":"Temporal Alignment Networks for Long-term Video","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.02968","snapshot_observed_at":"2026-08-07T15:03:37.830852Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.16425","last_updated":"2025-05-22T09:10:09Z","snapshot_observed_at":"2026-08-09T16:14:10.026741Z","submitted_at":"2025-05-22T09:10:09Z","title":"$I^2G$: Generating Instructional Illustrations via Text-Conditioned Diffusion","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T15:03:37.830852Z"},"links":{"cited_paper":"/paper/2204.02968","citing_paper":"/paper/2505.16425"},"observation_digest":"sha256:83e321c785cbc63c475d0f4e27de7f656723d307f49ead0dd32cf9c1f470790f","observation_id":"75349684-e6b9-4c77-8b2e-337290b9b556","resolution":{"observed_at":"2026-08-07T15:03:37.830852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09611","last_updated":"2023-12-29T10:15:15Z","snapshot_observed_at":"2026-08-10T13:12:19.702351Z","submitted_at":"2022-12-19T16:50:41Z","title":"Optimizing Prompts for Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09611","snapshot_observed_at":"2026-08-07T15:03:37.951089Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16425","last_updated":"2025-05-22T09:10:09Z","snapshot_observed_at":"2026-08-09T16:14:10.026741Z","submitted_at":"2025-05-22T09:10:09Z","title":"$I^2G$: Generating Instructional Illustrations via Text-Conditioned Diffusion","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T15:03:37.951089Z"},"links":{"cited_paper":"/paper/2212.09611","citing_paper":"/paper/2505.16425"},"observation_digest":"sha256:a8735b5438f5b1f2896aac2d568dfc7af5ce9c8f05981b1fca78003a8a6887a1","observation_id":"80ce3f2d-e36e-4972-a64b-0bee5c49a276","resolution":{"observed_at":"2026-08-07T15:03:37.951089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-07T15:03:38.064399Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.16425","last_updated":"2025-05-22T09:10:09Z","snapshot_observed_at":"2026-08-09T16:14:10.026741Z","submitted_at":"2025-05-22T09:10:09Z","title":"$I^2G$: Generating Instructional Illustrations via Text-Conditioned Diffusion","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T15:03:38.064399Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2505.16425"},"observation_digest":"sha256:68d74273ef7d576ea095ad2adc744c81f9b277dec5a339223a86cecce9cdd847","observation_id":"16ed4664-fc04-4e15-a13a-c6d6b349a2c4","resolution":{"observed_at":"2026-08-07T15:03:38.064399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.11239","last_updated":"2020-12-16T21:15:05Z","snapshot_observed_at":"2026-08-10T05:21:27.485481Z","submitted_at":"2020-06-19T17:24:44Z","title":"Denoising Diffusion Probabilistic Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.11239","snapshot_observed_at":"2026-08-07T15:03:38.202182Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.16425","last_updated":"2025-05-22T09:10:09Z","snapshot_observed_at":"2026-08-09T16:14:10.026741Z","submitted_at":"2025-05-22T09:10:09Z","title":"$I^2G$: Generating Instructional Illustrations via Text-Conditioned Diffusion","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T15:03:38.202182Z"},"links":{"cited_paper":"/paper/2006.11239","citing_paper":"/paper/2505.16425"},"observation_digest":"sha256:0d01222760ab9c21a0780e01c57656745d1b57516ea183c6790edeb25fffe3ee","observation_id":"3c6c03ac-590d-45eb-b9a4-985275f1e651","resolution":{"observed_at":"2026-08-07T15:03:38.202182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01569","last_updated":"2023-11-23T17:07:58Z","snapshot_observed_at":"2026-08-13T11:50:39.438461Z","submitted_at":"2023-05-02T16:18:11Z","title":"Pick-a-Pic: An Open Dataset of User Preferences for Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01569","snapshot_observed_at":"2026-08-07T15:03:38.348720Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16425","last_updated":"2025-05-22T09:10:09Z","snapshot_observed_at":"2026-08-09T16:14:10.026741Z","submitted_at":"2025-05-22T09:10:09Z","title":"$I^2G$: Generating Instructional Illustrations via Text-Conditioned Diffusion","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T15:03:38.348720Z"},"links":{"cited_paper":"/paper/2305.01569","citing_paper":"/paper/2505.16425"},"observation_digest":"sha256:0b74332109dac27b8a1db21766dc27cc1d63afa42eb554539b708a16737330ab","observation_id":"9b378390-b238-43e1-88f4-8300d51e0654","resolution":{"observed_at":"2026-08-07T15:03:38.348720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:03:38.529587Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.16425","last_updated":"2025-05-22T09:10:09Z","snapshot_observed_at":"2026-08-09T16:14:10.026741Z","submitted_at":"2025-05-22T09:10:09Z","title":"$I^2G$: Generating Instructional Illustrations via Text-Conditioned Diffusion","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T15:03:38.529587Z"},"links":{"citing_paper":"/paper/2505.16425"},"observation_digest":"sha256:f0aa74c3367faf50caeaa5ab68c3f241cae7a57382d45bff46ecf673a7244894","observation_id":"b99cc7aa-52ee-4e2b-a7f6-f8fafb64ddfe","resolution":{"observed_at":"2026-08-07T15:03:38.529587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.12192","last_updated":"2023-02-23T17:34:53Z","snapshot_observed_at":"2026-07-06T14:55:12.100148Z","submitted_at":"2023-02-23T17:34:53Z","title":"Aligning Text-to-Image Models using Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.12192","snapshot_observed_at":"2026-08-07T15:03:38.645140Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16425","last_updated":"2025-05-22T09:10:09Z","snapshot_observed_at":"2026-08-09T16:14:10.026741Z","submitted_at":"2025-05-22T09:10:09Z","title":"$I^2G$: Generating Instructional Illustrations via Text-Conditioned Diffusion","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T15:03:38.645140Z"},"links":{"cited_paper":"/paper/2302.12192","citing_paper":"/paper/2505.16425"},"observation_digest":"sha256:c40642bc456bc7794015122b6164affa10154cdbd1c07633660d7ef98c9485b1","observation_id":"c9e1149b-1b73-4a62-bc96-adaa729df42c","resolution":{"observed_at":"2026-08-07T15:03:38.645140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:03:38.774002Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16425","last_updated":"2025-05-22T09:10:09Z","snapshot_observed_at":"2026-08-09T16:14:10.026741Z","submitted_at":"2025-05-22T09:10:09Z","title":"$I^2G$: Generating Instructional Illustrations via Text-Conditioned Diffusion","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T15:03:38.774002Z"},"links":{"citing_paper":"/paper/2505.16425"},"observation_digest":"sha256:11b2696936bd2b7d7eb6e1d0c76ff18cacf9a21f94db38f63dda339bab0c2228","observation_id":"55fb65d7-3118-4f58-81b1-93fb4e89c5a1","resolution":{"observed_at":"2026-08-07T15:03:38.774002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04465","last_updated":"2024-10-11T19:43:11Z","snapshot_observed_at":"2026-08-13T00:36:44.636118Z","submitted_at":"2024-04-06T01:23:23Z","title":"Aligning Diffusion Models by Optimizing Human Utility","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04465","snapshot_observed_at":"2026-08-07T15:03:38.853890Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16425","last_updated":"2025-05-22T09:10:09Z","snapshot_observed_at":"2026-08-09T16:14:10.026741Z","submitted_at":"2025-05-22T09:10:09Z","title":"$I^2G$: Generating Instructional Illustrations via Text-Conditioned Diffusion","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T15:03:38.853890Z"},"links":{"cited_paper":"/paper/2404.04465","citing_paper":"/paper/2505.16425"},"observation_digest":"sha256:7f341c2842a0b1d286d453b5297cfdbedc74a889db6d17f80f33c42065617b76","observation_id":"ebb8b2a7-fe66-4f67-9d37-b9d5ebc0c942","resolution":{"observed_at":"2026-08-07T15:03:38.853890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.10990","last_updated":"2022-06-16T21:44:50Z","snapshot_observed_at":"2026-08-05T11:22:05.127208Z","submitted_at":"2022-01-26T15:06:28Z","title":"Learning To Recognize Procedural Activities with Distant Supervision","version":3},"cited_work":{"arxiv_id":"2201.10990","doi":null,"metadata_source":"pith","pith_arxiv_id":"2201.10990","snapshot_observed_at":"2026-08-07T15:03:45.160570Z","title":"Learning To Recognize Procedural Activities with Distant Supervision","venue":"cs.CV","work_id":"cc6e8c75-172e-42d8-99b2-d8840e5a8890","year":2022},"citing_paper":{"arxiv_id":"2505.16425","last_updated":"2025-05-22T09:10:09Z","snapshot_observed_at":"2026-08-09T16:14:10.026741Z","submitted_at":"2025-05-22T09:10:09Z","title":"$I^2G$: Generating Instructional Illustrations via Text-Conditioned Diffusion","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T15:03:38.930421Z"},"links":{"cited_paper":"/paper/2201.10990","citing_paper":"/paper/2505.16425"},"observation_digest":"sha256:9306ce629f9c537c23be916f9678e9640394aa1602c3df419b48c8b5c1d3c31a","observation_id":"da03b956-f681-4ded-898d-e2bdeb741a3e","resolution":{"observed_at":"2026-08-07T15:03:45.262945Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14167","last_updated":"2024-12-18T18:59:49Z","snapshot_observed_at":"2026-08-11T12:22:39.635800Z","submitted_at":"2024-12-18T18:59:49Z","title":"VideoDPO: Omni-Preference Alignment for Video Diffusion Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14167","snapshot_observed_at":"2026-08-07T15:03:39.100590Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16425","last_updated":"2025-05-22T09:10:09Z","snapshot_observed_at":"2026-08-09T16:14:10.026741Z","submitted_at":"2025-05-22T09:10:09Z","title":"$I^2G$: Generating Instructional Illustrations via Text-Conditioned Diffusion","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T15:03:39.100590Z"},"links":{"cited_paper":"/paper/2412.14167","citing_paper":"/paper/2505.16425"},"observation_digest":"sha256:631abf7ca3d5d90984290df1ecabe8306901d5e91d8fc7e6c4f0a7f36924d93e","observation_id":"4436ae88-6107-41d9-8836-d8f293434a2e","resolution":{"observed_at":"2026-08-07T15:03:39.100590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.12745","last_updated":"2022-03-27T07:41:52Z","snapshot_observed_at":"2026-07-06T12:51:34.303414Z","submitted_at":"2022-03-23T22:11:43Z","title":"UMT: Unified Multi-modal Transformers for Joint Video Moment Retrieval and Highlight Detection","version":2},"cited_work":{"arxiv_id":"2203.12745","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.12745","snapshot_observed_at":"2026-08-07T15:03:45.011715Z","title":"UMT: Unified Multi-modal Transformers for Joint Video Moment Retrieval and Highlight Detection","venue":"cs.CV","work_id":"ce956243-f6d7-420f-bd0a-8ea9c70139ed","year":2022},"citing_paper":{"arxiv_id":"2505.16425","last_updated":"2025-05-22T09:10:09Z","snapshot_observed_at":"2026-08-09T16:14:10.026741Z","submitted_at":"2025-05-22T09:10:09Z","title":"$I^2G$: Generating Instructional Illustrations via Text-Conditioned Diffusion","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T15:03:39.251120Z"},"links":{"cited_paper":"/paper/2203.12745","citing_paper":"/paper/2505.16425"},"observation_digest":"sha256:b15d0ac0d7d4b7350ca37d91feae173ee8668098f66eef11f26b11bf850da404","observation_id":"a626065a-b04c-415b-9b38-f11e173b044c","resolution":{"observed_at":"2026-08-07T15:03:45.058912Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15369","last_updated":"2025-04-21T18:20:13Z","snapshot_observed_at":"2026-08-07T16:00:28.667198Z","submitted_at":"2025-04-21T18:20:13Z","title":"Solving New Tasks by Adapting Internet Video Knowledge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.15369","snapshot_observed_at":"2026-08-07T15:03:39.351300Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16425","last_updated":"2025-05-22T09:10:09Z","snapshot_observed_at":"2026-08-09T16:14:10.026741Z","submitted_at":"2025-05-22T09:10:09Z","title":"$I^2G$: Generating Instructional Illustrations via Text-Conditioned Diffusion","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T15:03:39.351300Z"},"links":{"cited_paper":"/paper/2504.15369","citing_paper":"/paper/2505.16425"},"observation_digest":"sha256:2557d4b80821dcdc03893f23dbc053e056302d4eeedfa8444fd3927d549e71b6","observation_id":"f51cdcfd-4231-4f1c-a9df-49631214729d","resolution":{"observed_at":"2026-08-07T15:03:39.351300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04552","last_updated":"2024-04-12T18:34:31Z","snapshot_observed_at":"2026-08-13T05:07:42.816062Z","submitted_at":"2023-12-07T18:59:20Z","title":"Generating Illustrated Instructions","version":2},"cited_work":{"arxiv_id":"2312.04552","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.04552","snapshot_observed_at":"2026-08-07T15:03:44.840354Z","title":"Generating Illustrated Instructions","venue":"cs.CV","work_id":"f423df09-dde6-4ccb-8e5f-be62b32c92c6","year":2023},"citing_paper":{"arxiv_id":"2505.16425","last_updated":"2025-05-22T09:10:09Z","snapshot_observed_at":"2026-08-09T16:14:10.026741Z","submitted_at":"2025-05-22T09:10:09Z","title":"$I^2G$: Generating Instructional Illustrations via Text-Conditioned Diffusion","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T15:03:39.512797Z"},"links":{"cited_paper":"/paper/2312.04552","citing_paper":"/paper/2505.16425"},"observation_digest":"sha256:92ce263c066aa11fd61f91715d7aed80236682314a03b4b16bd2a99ae948a48c","observation_id":"ef3a9452-43ae-4d55-8aff-20418f6b7e09","resolution":{"observed_at":"2026-08-07T15:03:44.923870Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06430","last_updated":"2020-08-23T12:20:59Z","snapshot_observed_at":"2026-08-11T04:17:05.106798Z","submitted_at":"2019-12-13T11:59:58Z","title":"End-to-End Learning of Visual Representations from Uncurated Instructional Videos","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06430","snapshot_observed_at":"2026-08-07T15:03:39.673028Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.16425","last_updated":"2025-05-22T09:10:09Z","snapshot_observed_at":"2026-08-09T16:14:10.026741Z","submitted_at":"2025-05-22T09:10:09Z","title":"$I^2G$: Generating Instructional Illustrations via Text-Conditioned Diffusion","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T15:03:39.673028Z"},"links":{"cited_paper":"/paper/1912.06430","citing_paper":"/paper/2505.16425"},"observation_digest":"sha256:4284eec7b5acdbe38a67f83933b84f7b88ab66ade64c3a8a51f21554bc0cd65a","observation_id":"c57b2b1f-fc7a-4ba2-ba09-529105cae8ea","resolution":{"observed_at":"2026-08-07T15:03:39.673028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14556","last_updated":"2024-12-09T01:35:34Z","snapshot_observed_at":"2026-08-13T04:55:27.266077Z","submitted_at":"2023-12-22T09:29:45Z","title":"CaptainCook4D: A Dataset for Understanding Errors in Procedural Activities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14556","snapshot_observed_at":"2026-08-07T15:03:39.803189Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16425","last_updated":"2025-05-22T09:10:09Z","snapshot_observed_at":"2026-08-09T16:14:10.026741Z","submitted_at":"2025-05-22T09:10:09Z","title":"$I^2G$: Generating Instructional Illustrations via Text-Conditioned Diffusion","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T15:03:39.803189Z"},"links":{"cited_paper":"/paper/2312.14556","citing_paper":"/paper/2505.16425"},"observation_digest":"sha256:a0d61c0112087599f4835aabcf8a9322177c396a89367d8692d41a1fa1fae9cd","observation_id":"4227ee8f-183d-4e50-a91a-164bf27a4b8e","resolution":{"observed_at":"2026-08-07T15:03:39.803189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-07T15:03:39.954864Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16425","last_updated":"2025-05-22T09:10:09Z","snapshot_observed_at":"2026-08-09T16:14:10.026741Z","submitted_at":"2025-05-22T09:10:09Z","title":"$I^2G$: Generating Instructional Illustrations via Text-Conditioned Diffusion","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T15:03:39.954864Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2505.16425"},"observation_digest":"sha256:3df18cb6ad1fb23210941a8c5640e8b8b500c8520c3847875fd8b8aebc101d93","observation_id":"9d037a58-593c-42cf-ae70-d7a43bfb84e3","resolution":{"observed_at":"2026-08-07T15:03:39.954864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03739","last_updated":"2024-11-07T03:54:22Z","snapshot_observed_at":"2026-07-06T16:28:22.350574Z","submitted_at":"2023-10-05T17:59:18Z","title":"Aligning Text-to-Image Diffusion Models with Reward Backpropagation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03739","snapshot_observed_at":"2026-08-07T15:03:40.138551Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16425","last_updated":"2025-05-22T09:10:09Z","snapshot_observed_at":"2026-08-09T16:14:10.026741Z","submitted_at":"2025-05-22T09:10:09Z","title":"$I^2G$: Generating Instructional Illustrations via Text-Conditioned Diffusion","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T15:03:40.138551Z"},"links":{"cited_paper":"/paper/2310.03739","citing_paper":"/paper/2505.16425"},"observation_digest":"sha256:2e0fe5549152e8075fa6267c023814efb7b7ac41b3e4851de83a25a73864e34c","observation_id":"d56fca1a-9741-4051-9fe7-488528d479cf","resolution":{"observed_at":"2026-08-07T15:03:40.138551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:03:40.248662Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.16425","last_updated":"2025-05-22T09:10:09Z","snapshot_observed_at":"2026-08-09T16:14:10.026741Z","submitted_at":"2025-05-22T09:10:09Z","title":"$I^2G$: Generating Instructional Illustrations via Text-Conditioned Diffusion","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T15:03:40.248662Z"},"links":{"citing_paper":"/paper/2505.16425"},"observation_digest":"sha256:3e55fcf304e95cb862b411d0ef5330188a474a425a8bc3dccb6c7e8990e56a89","observation_id":"0d24491a-98fb-4bce-ba9f-fa3b4837b96e","resolution":{"observed_at":"2026-08-07T15:03:40.248662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:03:40.416719Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.16425","last_updated":"2025-05-22T09:10:09Z","snapshot_observed_at":"2026-08-09T16:14:10.026741Z","submitted_at":"2025-05-22T09:10:09Z","title":"$I^2G$: Generating Instructional Illustrations via Text-Conditioned Diffusion","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T15:03:40.416719Z"},"links":{"citing_paper":"/paper/2505.16425"},"observation_digest":"sha256:51bdd551a5798d24ad8e43c0779269b82024d464beb01ce5328a95ef18530e47","observation_id":"6ee5cd23-a80c-47a9-ad2f-2bc5183b76e4","resolution":{"observed_at":"2026-08-07T15:03:40.416719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17352","last_updated":"2025-02-24T17:29:10Z","snapshot_observed_at":"2026-08-07T17:52:36.034972Z","submitted_at":"2025-02-24T17:29:10Z","title":"Leveraging Procedural Knowledge and Task Hierarchies for Efficient Instructional Video Pre-training","version":1},"cited_work":{"arxiv_id":"2502.17352","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.17352","snapshot_observed_at":"2026-08-07T15:03:44.643928Z","title":"Leveraging Procedural Knowledge and Task Hierarchies for Efficient Instructional Video Pre-training","venue":"cs.CV","work_id":"8000d0e0-a22b-4372-b6f6-fc68b6306117","year":2025},"citing_paper":{"arxiv_id":"2505.16425","last_updated":"2025-05-22T09:10:09Z","snapshot_observed_at":"2026-08-09T16:14:10.026741Z","submitted_at":"2025-05-22T09:10:09Z","title":"$I^2G$: Generating Instructional Illustrations via Text-Conditioned Diffusion","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T15:03:40.666014Z"},"links":{"cited_paper":"/paper/2502.17352","citing_paper":"/paper/2505.16425"},"observation_digest":"sha256:7c619485b315927f49eff57548ff7530483d97189efea3d7a02befff4e5ceb54","observation_id":"5a2974dc-3e1b-4f5e-aed9-c8f1c40f29e3","resolution":{"observed_at":"2026-08-07T15:03:44.698797Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16656","last_updated":"2023-10-25T14:10:08Z","snapshot_observed_at":"2026-08-13T05:40:39.961511Z","submitted_at":"2023-10-25T14:10:08Z","title":"A Picture is Worth a Thousand Words: Principled Recaptioning Improves Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16656","snapshot_observed_at":"2026-08-07T15:03:40.893656Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16425","last_updated":"2025-05-22T09:10:09Z","snapshot_observed_at":"2026-08-09T16:14:10.026741Z","submitted_at":"2025-05-22T09:10:09Z","title":"$I^2G$: Generating Instructional Illustrations via Text-Conditioned Diffusion","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T15:03:40.893656Z"},"links":{"cited_paper":"/paper/2310.16656","citing_paper":"/paper/2505.16425"},"observation_digest":"sha256:e0f6ca0825573289787436706961c2e557ac3f54bd9bb6cf30499cd5a684e7df","observation_id":"0dbcb19f-e3a2-4a33-be81-10c4e94f8ce0","resolution":{"observed_at":"2026-08-07T15:03:40.893656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"6023.25060","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:03:44.422847Z","title":null,"venue":null,"work_id":"1f5c0170-a63c-4a2a-80db-0ab4cdc9f5cb","year":2013},"citing_paper":{"arxiv_id":"2505.16425","last_updated":"2025-05-22T09:10:09Z","snapshot_observed_at":"2026-08-09T16:14:10.026741Z","submitted_at":"2025-05-22T09:10:09Z","title":"$I^2G$: Generating Instructional Illustrations via Text-Conditioned Diffusion","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T15:03:41.027543Z"},"links":{"citing_paper":"/paper/2505.16425"},"observation_digest":"sha256:71fea0b0dddc3a34ee7a36eb725f77e0757e12f37888946b7c09e30af4d59a33","observation_id":"0169d1e0-fe34-4e79-b267-84e931944174","resolution":{"observed_at":"2026-08-07T15:03:44.551874Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:03:41.212373Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.16425","last_updated":"2025-05-22T09:10:09Z","snapshot_observed_at":"2026-08-09T16:14:10.026741Z","submitted_at":"2025-05-22T09:10:09Z","title":"$I^2G$: Generating Instructional Illustrations via Text-Conditioned Diffusion","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T15:03:41.212373Z"},"links":{"citing_paper":"/paper/2505.16425"},"observation_digest":"sha256:b6fd53b5d2fd3d09bcee65042832df82344f37a353c6459776f08dc24c9cf680","observation_id":"2002d8ad-96a8-4d23-92d0-74e8c72a7948","resolution":{"observed_at":"2026-08-07T15:03:41.212373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12908","last_updated":"2023-11-21T15:24:05Z","snapshot_observed_at":"2026-08-13T05:20:21.767335Z","submitted_at":"2023-11-21T15:24:05Z","title":"Diffusion Model Alignment Using Direct Preference Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12908","snapshot_observed_at":"2026-08-07T15:03:41.362858Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16425","last_updated":"2025-05-22T09:10:09Z","snapshot_observed_at":"2026-08-09T16:14:10.026741Z","submitted_at":"2025-05-22T09:10:09Z","title":"$I^2G$: Generating Instructional Illustrations via Text-Conditioned Diffusion","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T15:03:41.362858Z"},"links":{"cited_paper":"/paper/2311.12908","citing_paper":"/paper/2505.16425"},"observation_digest":"sha256:4aa32d3464703807cf14f5ce8a15fe909235175491160e254e2179d6a9a6d047","observation_id":"416b32be-dc42-497c-b8b6-8a5c08946c2c","resolution":{"observed_at":"2026-08-07T15:03:41.362858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04048","last_updated":"2023-10-24T14:56:51Z","snapshot_observed_at":"2026-08-13T12:29:44.740535Z","submitted_at":"2023-03-07T16:57:20Z","title":"Is ChatGPT a Good NLG Evaluator? A Preliminary Study","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04048","snapshot_observed_at":"2026-08-07T15:03:41.497625Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16425","last_updated":"2025-05-22T09:10:09Z","snapshot_observed_at":"2026-08-09T16:14:10.026741Z","submitted_at":"2025-05-22T09:10:09Z","title":"$I^2G$: Generating Instructional Illustrations via Text-Conditioned Diffusion","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T15:03:41.497625Z"},"links":{"cited_paper":"/paper/2303.04048","citing_paper":"/paper/2505.16425"},"observation_digest":"sha256:6c74ba4a0223c87d58f8c38c838080181d0414b09e1e372b20ac39b2e0e37b64","observation_id":"e384682d-fe63-4e4f-81c2-40d84d611c53","resolution":{"observed_at":"2026-08-07T15:03:41.497625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07046","last_updated":"2025-04-09T17:04:14Z","snapshot_observed_at":"2026-08-07T16:07:07.841461Z","submitted_at":"2025-04-09T17:04:14Z","title":"A Unified Agentic Framework for Evaluating Conditional Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07046","snapshot_observed_at":"2026-08-07T15:03:41.644976Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16425","last_updated":"2025-05-22T09:10:09Z","snapshot_observed_at":"2026-08-09T16:14:10.026741Z","submitted_at":"2025-05-22T09:10:09Z","title":"$I^2G$: Generating Instructional Illustrations via Text-Conditioned Diffusion","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T15:03:41.644976Z"},"links":{"cited_paper":"/paper/2504.07046","citing_paper":"/paper/2505.16425"},"observation_digest":"sha256:7b0068f25da18205aac600d8943ac131917003502d3026459a792166f4b8784d","observation_id":"3c41d0b5-a2cc-4e5a-894e-500555dff40a","resolution":{"observed_at":"2026-08-07T15:03:41.644976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.17926","last_updated":"2023-08-30T13:22:35Z","snapshot_observed_at":"2026-08-08T03:32:23.667881Z","submitted_at":"2023-05-29T07:41:03Z","title":"Large Language Models are not Fair Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.17926","snapshot_observed_at":"2026-08-07T15:03:41.863342Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16425","last_updated":"2025-05-22T09:10:09Z","snapshot_observed_at":"2026-08-09T16:14:10.026741Z","submitted_at":"2025-05-22T09:10:09Z","title":"$I^2G$: Generating Instructional Illustrations via Text-Conditioned Diffusion","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T15:03:41.863342Z"},"links":{"cited_paper":"/paper/2305.17926","citing_paper":"/paper/2505.16425"},"observation_digest":"sha256:15e2ae9b5beca5c3b1a40d9d06939294d4b44a0a6667c05845864d1f4dd8214b","observation_id":"f90e72b7-e5d5-4bbf-9174-cc80c38e0330","resolution":{"observed_at":"2026-08-07T15:03:41.863342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05040","last_updated":"2025-06-30T07:41:07Z","snapshot_observed_at":"2026-08-07T16:07:58.938906Z","submitted_at":"2025-04-07T13:05:09Z","title":"InstructionBench: An Instructional Video Understanding Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05040","snapshot_observed_at":"2026-08-07T15:03:41.979783Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16425","last_updated":"2025-05-22T09:10:09Z","snapshot_observed_at":"2026-08-09T16:14:10.026741Z","submitted_at":"2025-05-22T09:10:09Z","title":"$I^2G$: Generating Instructional Illustrations via Text-Conditioned Diffusion","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T15:03:41.979783Z"},"links":{"cited_paper":"/paper/2504.05040","citing_paper":"/paper/2505.16425"},"observation_digest":"sha256:89c5a2b7093998757451d07ae32de3b2c508cbaf7a3133be7fa72a1fec4b9580","observation_id":"7865345f-9366-4fe4-86b5-9feea14bb89e","resolution":{"observed_at":"2026-08-07T15:03:41.979783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07829","last_updated":"2025-02-10T20:25:11Z","snapshot_observed_at":"2026-08-08T13:59:40.128549Z","submitted_at":"2025-02-10T20:25:11Z","title":"Preference Alignment on Diffusion Model: A Comprehensive Survey for Image Generation and Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07829","snapshot_observed_at":"2026-08-07T15:03:42.075088Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16425","last_updated":"2025-05-22T09:10:09Z","snapshot_observed_at":"2026-08-09T16:14:10.026741Z","submitted_at":"2025-05-22T09:10:09Z","title":"$I^2G$: Generating Instructional Illustrations via Text-Conditioned Diffusion","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T15:03:42.075088Z"},"links":{"cited_paper":"/paper/2502.07829","citing_paper":"/paper/2505.16425"},"observation_digest":"sha256:279cfa8392d59e26a431cef905737b55ec663b7f87ff5759d7a72003297a0d00","observation_id":"cc03890c-d637-4de9-869d-5b6a16afdb0f","resolution":{"observed_at":"2026-08-07T15:03:42.075088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.08486","last_updated":"2024-02-20T22:22:00Z","snapshot_observed_at":"2026-08-09T16:11:49.491678Z","submitted_at":"2021-10-16T06:12:15Z","title":"Understanding Multimodal Procedural Knowledge by Sequencing Multimodal Instructional Manuals","version":4},"cited_work":{"arxiv_id":"2110.08486","doi":null,"metadata_source":"pith","pith_arxiv_id":"2110.08486","snapshot_observed_at":"2026-08-07T15:03:44.071420Z","title":"Understanding Multimodal Procedural Knowledge by Sequencing Multimodal Instructional Manuals","venue":"cs.CL","work_id":"99389ad4-1743-4ea6-b64f-5842bf3125ab","year":2021},"citing_paper":{"arxiv_id":"2505.16425","last_updated":"2025-05-22T09:10:09Z","snapshot_observed_at":"2026-08-09T16:14:10.026741Z","submitted_at":"2025-05-22T09:10:09Z","title":"$I^2G$: Generating Instructional Illustrations via Text-Conditioned Diffusion","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T15:03:42.159502Z"},"links":{"cited_paper":"/paper/2110.08486","citing_paper":"/paper/2505.16425"},"observation_digest":"sha256:7ac9c54f49c83c708c4ed2d1c572d5945b218a79bc2179bcdc27424e0efdc36e","observation_id":"997702fa-f5f5-4326-b142-5453fbd1c112","resolution":{"observed_at":"2026-08-07T15:03:44.113000Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09341","last_updated":"2023-09-25T08:19:23Z","snapshot_observed_at":"2026-08-13T09:05:45.892435Z","submitted_at":"2023-06-15T17:59:31Z","title":"Human Preference Score v2: A Solid Benchmark for Evaluating Human Preferences of Text-to-Image Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09341","snapshot_observed_at":"2026-08-07T15:03:42.304578Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16425","last_updated":"2025-05-22T09:10:09Z","snapshot_observed_at":"2026-08-09T16:14:10.026741Z","submitted_at":"2025-05-22T09:10:09Z","title":"$I^2G$: Generating Instructional Illustrations via Text-Conditioned Diffusion","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T15:03:42.304578Z"},"links":{"cited_paper":"/paper/2306.09341","citing_paper":"/paper/2505.16425"},"observation_digest":"sha256:f7692f79ff061e6d52373ec57706f88294dfe3ff08e6773758b1998b6ab21c9f","observation_id":"832f6dee-fc45-49bd-a327-c598cc61b5ce","resolution":{"observed_at":"2026-08-07T15:03:42.304578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.05977","last_updated":"2023-12-28T14:13:35Z","snapshot_observed_at":"2026-08-13T12:04:07.414191Z","submitted_at":"2023-04-12T16:58:13Z","title":"ImageReward: Learning and Evaluating Human Preferences for Text-to-Image Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.05977","snapshot_observed_at":"2026-08-07T15:03:42.406631Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16425","last_updated":"2025-05-22T09:10:09Z","snapshot_observed_at":"2026-08-09T16:14:10.026741Z","submitted_at":"2025-05-22T09:10:09Z","title":"$I^2G$: Generating Instructional Illustrations via Text-Conditioned Diffusion","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T15:03:42.406631Z"},"links":{"cited_paper":"/paper/2304.05977","citing_paper":"/paper/2505.16425"},"observation_digest":"sha256:dc984a70157e4c1ad068895492c805bfebcc78a04f4c35652fcfee3f7612949b","observation_id":"6c57587c-f0ce-4322-b7dc-6e32063275de","resolution":{"observed_at":"2026-08-07T15:03:42.406631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02782","last_updated":"2025-05-02T04:42:06Z","snapshot_observed_at":"2026-08-07T16:10:49.986016Z","submitted_at":"2025-04-03T17:23:16Z","title":"GPT-ImgEval: A Comprehensive Benchmark for Diagnosing GPT4o in Image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02782","snapshot_observed_at":"2026-08-07T15:03:42.511905Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16425","last_updated":"2025-05-22T09:10:09Z","snapshot_observed_at":"2026-08-09T16:14:10.026741Z","submitted_at":"2025-05-22T09:10:09Z","title":"$I^2G$: Generating Instructional Illustrations via Text-Conditioned Diffusion","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T15:03:42.511905Z"},"links":{"cited_paper":"/paper/2504.02782","citing_paper":"/paper/2505.16425"},"observation_digest":"sha256:0523a2a4ecab6254d812533b81d011edf1da067c7099c49fca710e76b7f9aec3","observation_id":"659a86de-e39c-4353-bd2d-05ab46ad2efe","resolution":{"observed_at":"2026-08-07T15:03:42.511905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:03:45.821917Z","title":null,"venue":null,"work_id":"5ff90265-4af7-48f2-ab2b-5fe64f4ef9fe","year":2025},"citing_paper":{"arxiv_id":"2505.16425","last_updated":"2025-05-22T09:10:09Z","snapshot_observed_at":"2026-08-09T16:14:10.026741Z","submitted_at":"2025-05-22T09:10:09Z","title":"$I^2G$: Generating Instructional Illustrations via Text-Conditioned Diffusion","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T15:03:42.625227Z"},"links":{"citing_paper":"/paper/2505.16425"},"observation_digest":"sha256:8c0512b0076934719609e897507783a56309c1ee60d92979d05e06d45cb6771a","observation_id":"12ee1582-3187-4244-a65d-6a713db5d35d","resolution":{"observed_at":"2026-08-07T15:03:45.870174Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.09980","last_updated":"2021-08-23T07:24:57Z","snapshot_observed_at":"2026-08-12T05:35:28.965775Z","submitted_at":"2021-08-23T07:24:57Z","title":"TACo: Token-aware Cascade Contrastive Learning for Video-Text Alignment","version":1},"cited_work":{"arxiv_id":"2108.09980","doi":null,"metadata_source":"pith","pith_arxiv_id":"2108.09980","snapshot_observed_at":"2026-08-07T15:03:43.885012Z","title":"TACo: Token-aware Cascade Contrastive Learning for Video-Text Alignment","venue":"cs.CV","work_id":"1def2378-98fe-485f-9690-21eecef472ac","year":2021},"citing_paper":{"arxiv_id":"2505.16425","last_updated":"2025-05-22T09:10:09Z","snapshot_observed_at":"2026-08-09T16:14:10.026741Z","submitted_at":"2025-05-22T09:10:09Z","title":"$I^2G$: Generating Instructional Illustrations via Text-Conditioned Diffusion","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T15:03:42.730202Z"},"links":{"cited_paper":"/paper/2108.09980","citing_paper":"/paper/2505.16425"},"observation_digest":"sha256:1bb387cc007ec4f2d440dc763b4f47d2dfa8a223c054386a475fdd2af0bbf87a","observation_id":"57458f01-5592-4942-8de0-9254e0cc4ca3","resolution":{"observed_at":"2026-08-07T15:03:43.937656Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:03:42.818795Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.16425","last_updated":"2025-05-22T09:10:09Z","snapshot_observed_at":"2026-08-09T16:14:10.026741Z","submitted_at":"2025-05-22T09:10:09Z","title":"$I^2G$: Generating Instructional Illustrations via Text-Conditioned Diffusion","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T15:03:42.818795Z"},"links":{"citing_paper":"/paper/2505.16425"},"observation_digest":"sha256:b37018f1c1abcc6f26bc7e3b58520f22fa7806bdce2c6f56f62bde13fd4bb683","observation_id":"3bbbec6c-3c3c-4d8f-bc36-205b1ddf5267","resolution":{"observed_at":"2026-08-07T15:03:42.818795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.13231","last_updated":"2024-03-23T05:23:00Z","snapshot_observed_at":"2026-08-13T05:19:51.443633Z","submitted_at":"2023-11-22T08:42:46Z","title":"Using Human Feedback to Fine-tune Diffusion Models without Any Reward Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.13231","snapshot_observed_at":"2026-08-07T15:03:42.921285Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16425","last_updated":"2025-05-22T09:10:09Z","snapshot_observed_at":"2026-08-09T16:14:10.026741Z","submitted_at":"2025-05-22T09:10:09Z","title":"$I^2G$: Generating Instructional Illustrations via Text-Conditioned Diffusion","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T15:03:42.921285Z"},"links":{"cited_paper":"/paper/2311.13231","citing_paper":"/paper/2505.16425"},"observation_digest":"sha256:d374b9ea8da3fdea67f78a3ee7b23b4a1b0980c20526676fd45eea90cf87ab34","observation_id":"398b40fe-c1b4-4450-bb19-7ecc2e1db96a","resolution":{"observed_at":"2026-08-07T15:03:42.921285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:03:42.997502Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16425","last_updated":"2025-05-22T09:10:09Z","snapshot_observed_at":"2026-08-09T16:14:10.026741Z","submitted_at":"2025-05-22T09:10:09Z","title":"$I^2G$: Generating Instructional Illustrations via Text-Conditioned Diffusion","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T15:03:42.997502Z"},"links":{"citing_paper":"/paper/2505.16425"},"observation_digest":"sha256:646e070e5ab6c7584e4fcca6f088e96ef70d6e01aeb94c75a0ce728a2760d64d","observation_id":"4cf6cb1f-b73d-4ca2-81c3-6b1521989a1a","resolution":{"observed_at":"2026-08-07T15:03:42.997502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.05845","last_updated":"2021-09-10T03:10:13Z","snapshot_observed_at":"2026-08-12T08:12:57.919408Z","submitted_at":"2021-04-12T22:20:09Z","title":"Visual Goal-Step Inference using wikiHow","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.05845","snapshot_observed_at":"2026-08-07T15:03:43.097879Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.16425","last_updated":"2025-05-22T09:10:09Z","snapshot_observed_at":"2026-08-09T16:14:10.026741Z","submitted_at":"2025-05-22T09:10:09Z","title":"$I^2G$: Generating Instructional Illustrations via Text-Conditioned Diffusion","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T15:03:43.097879Z"},"links":{"cited_paper":"/paper/2104.05845","citing_paper":"/paper/2505.16425"},"observation_digest":"sha256:5b48cecb8297f5d807208817974de1319ae1354f117327826edfc77bd5222813","observation_id":"5f38af04-436b-4d55-9f49-64e217bb05fa","resolution":{"observed_at":"2026-08-07T15:03:43.097879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1903.08225","last_updated":"2019-04-29T10:08:57Z","snapshot_observed_at":"2026-08-09T15:14:14.469294Z","submitted_at":"2019-03-19T19:30:29Z","title":"Cross-task weakly supervised learning from instructional videos","version":2},"cited_work":{"arxiv_id":"1903.08225","doi":null,"metadata_source":"pith","pith_arxiv_id":"1903.08225","snapshot_observed_at":"2026-08-07T15:03:43.545696Z","title":"Cross-task weakly supervised learning from instructional videos","venue":"cs.CV","work_id":"b92be71f-5366-4bc5-ac86-a6eb3c84a08e","year":2019},"citing_paper":{"arxiv_id":"2505.16425","last_updated":"2025-05-22T09:10:09Z","snapshot_observed_at":"2026-08-09T16:14:10.026741Z","submitted_at":"2025-05-22T09:10:09Z","title":"$I^2G$: Generating Instructional Illustrations via Text-Conditioned Diffusion","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T15:03:43.173568Z"},"links":{"cited_paper":"/paper/1903.08225","citing_paper":"/paper/2505.16425"},"observation_digest":"sha256:64c5a85474dd2ea77862f767fc15396fa19a0554b19eb02dbcb2a97e97c913cb","observation_id":"8eeac2db-e9ca-433c-a022-eb5f4997b90a","resolution":{"observed_at":"2026-08-07T15:03:43.631263Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:03:43.313545Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16425","last_updated":"2025-05-22T09:10:09Z","snapshot_observed_at":"2026-08-09T16:14:10.026741Z","submitted_at":"2025-05-22T09:10:09Z","title":"$I^2G$: Generating Instructional Illustrations via Text-Conditioned Diffusion","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T15:03:43.313545Z"},"links":{"citing_paper":"/paper/2505.16425"},"observation_digest":"sha256:1ec98fed733450500609f83fb8719aeebc3954383bd2d3758cba46b9838019e4","observation_id":"81dd66e2-cc78-4e95-a2c1-1c620547de33","resolution":{"observed_at":"2026-08-07T15:03:43.313545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:03:43.408265Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16425","last_updated":"2025-05-22T09:10:09Z","snapshot_observed_at":"2026-08-09T16:14:10.026741Z","submitted_at":"2025-05-22T09:10:09Z","title":"$I^2G$: Generating Instructional Illustrations via Text-Conditioned Diffusion","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T15:03:43.408265Z"},"links":{"citing_paper":"/paper/2505.16425"},"observation_digest":"sha256:875119a0da9f8c5660dcebb03a489e6084cc08631e1aa9c601e6b52473dd7155","observation_id":"b0e48172-576e-493d-863d-9155ee43bf20","resolution":{"observed_at":"2026-08-07T15:03:43.408265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.16425","last_updated":"2025-05-22T09:10:09Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T16:14:10.026741Z","submitted_at":"2025-05-22T09:10:09Z","title":"$I^2G$: Generating Instructional Illustrations via Text-Conditioned Diffusion"},"reference_resolution":{"displayed":61,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":51,"verified_exact":8,"verified_fuzzy":1},"total_outbound_references":61},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 61 of 61 outbound references and 0 inbound Pith citation observations for arXiv:2505.16425."}