{"as_of":"2026-08-12T08:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:612734573206ead658bc4b75c927275c7b799f93dc37c4bb8763bd21b10a41db","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T00:58:34.816586Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T18:05:35.078581Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-05T13:50:54.825239Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.18033","last_updated":"2025-01-29T22:42:05Z","snapshot_observed_at":"2026-08-11T17:55:22.401089Z","submitted_at":"2025-01-29T22:42:05Z","title":"Generative AI for Vision: A Comprehensive Study of Frameworks and Applications","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18033","snapshot_observed_at":"2026-08-05T18:05:35.078581Z","title":"Generative ai for vision: A comprehensive study of frameworks and applications","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.15227","last_updated":"2025-08-21T04:31:01Z","snapshot_observed_at":"2026-08-08T04:44:19.662414Z","submitted_at":"2025-08-21T04:31:01Z","title":"GenTune: Toward Traceable Prompts to Improve Controllability of Image Refinement in Environment Design","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T18:05:35.078581Z"},"links":{"cited_paper":"/paper/2501.18033","citing_paper":"/paper/2508.15227"},"observation_digest":"sha256:3e73de3dc41fef283e334153e0f65d76bbe5f7dce408c912a42ede7bf2a965d0","observation_id":"8322d647-05dc-419e-a2bc-c0c386bab16e","resolution":{"observed_at":"2026-08-05T18:05:35.078581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18033","last_updated":"2025-01-29T22:42:05Z","snapshot_observed_at":"2026-08-11T17:55:22.401089Z","submitted_at":"2025-01-29T22:42:05Z","title":"Generative AI for Vision: A Comprehensive Study of Frameworks and Applications","version":1},"cited_work":{"arxiv_id":"2501.18033","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.18033","snapshot_observed_at":"2026-08-05T13:50:54.825239Z","title":"Generative AI for Vision: A Comprehensive Study of Frameworks and Applications","venue":"cs.CV","work_id":"365d4cb8-8cdb-4937-a7c6-cfdb9cd110b0","year":2025},"citing_paper":{"arxiv_id":"2509.00284","last_updated":"2025-08-29T23:58:08Z","snapshot_observed_at":"2026-08-11T01:57:40.313001Z","submitted_at":"2025-08-29T23:58:08Z","title":"Generative AI for Industrial Contour Detection: A Language-Guided Vision System","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T13:50:51.598947Z"},"links":{"cited_paper":"/paper/2501.18033","citing_paper":"/paper/2509.00284"},"observation_digest":"sha256:de5ed093625b295e64ff2761d49636ba376e43b9e9c781a896d792df17682e76","observation_id":"8afc7f2f-4da9-4872-af67-7a4e0756d540","resolution":{"observed_at":"2026-08-05T13:50:54.900599Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.18033/citation-record","integrity":"/paper/2501.18033/integrity","json":"/paper/2501.18033/citation-record.json","paper":"/paper/2501.18033"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-10T00:58:34.687621Z","title":"Flamingo: A visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.18033","last_updated":"2025-01-29T22:42:05Z","snapshot_observed_at":"2026-08-11T17:55:22.401089Z","submitted_at":"2025-01-29T22:42:05Z","title":"Generative AI for Vision: A Comprehensive Study of Frameworks and Applications","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T00:58:34.687621Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2501.18033"},"observation_digest":"sha256:9616cec010dd021fc8496cf3e6498ce7cc1d9fda8d1a1718b7f8c6d9fa0def03","observation_id":"5d2ec1ba-9818-4141-b1c4-60a0ad8879fd","resolution":{"observed_at":"2026-08-10T00:58:34.687621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1701.07875","last_updated":"2017-12-06T20:01:54Z","snapshot_observed_at":"2026-07-06T05:27:45.080675Z","submitted_at":"2017-01-26T21:10:29Z","title":"Wasserstein GAN","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1701.07875","snapshot_observed_at":"2026-08-10T00:58:34.691958Z","title":"Wasserstein gan","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.18033","last_updated":"2025-01-29T22:42:05Z","snapshot_observed_at":"2026-08-11T17:55:22.401089Z","submitted_at":"2025-01-29T22:42:05Z","title":"Generative AI for Vision: A Comprehensive Study of Frameworks and Applications","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T00:58:34.691958Z"},"links":{"cited_paper":"/paper/1701.07875","citing_paper":"/paper/2501.18033"},"observation_digest":"sha256:00d06dc882c97db58812c8b397f996fe8a7b9e2cd82d648a3a28afcc86add24e","observation_id":"dc59e2d9-dd8a-48bf-91b6-74cafde60306","resolution":{"observed_at":"2026-08-10T00:58:34.691958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:58:35.183195Z","title":"Agentic systems: A guide to transforming indus- tries with vertical ai agents, 2025","venue":null,"work_id":"a2b5d63e-c8a5-4574-9285-92fa91684522","year":2025},"citing_paper":{"arxiv_id":"2501.18033","last_updated":"2025-01-29T22:42:05Z","snapshot_observed_at":"2026-08-11T17:55:22.401089Z","submitted_at":"2025-01-29T22:42:05Z","title":"Generative AI for Vision: A Comprehensive Study of Frameworks and Applications","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T00:58:34.695730Z"},"links":{"citing_paper":"/paper/2501.18033"},"observation_digest":"sha256:c917b545396d7f28156e411106f5b9edea1d5fb76813993082b29c536512549e","observation_id":"75dbb572-e3ac-4817-96df-3bfb978c375e","resolution":{"observed_at":"2026-08-10T00:58:35.185936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:58:35.176563Z","title":"Physical ai agents: Integrating cognitive intelli- gence with real-world action, 2025","venue":null,"work_id":"41bd1fe5-650e-4c72-9204-1c056d239300","year":2025},"citing_paper":{"arxiv_id":"2501.18033","last_updated":"2025-01-29T22:42:05Z","snapshot_observed_at":"2026-08-11T17:55:22.401089Z","submitted_at":"2025-01-29T22:42:05Z","title":"Generative AI for Vision: A Comprehensive Study of Frameworks and Applications","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T00:58:34.698996Z"},"links":{"citing_paper":"/paper/2501.18033"},"observation_digest":"sha256:4c6b0e35e420f6e259e451e70e9648fb00d9824be1adc428986ab842b28dcb2c","observation_id":"415d0328-c0c8-47c0-a7c1-f4ae09f35438","resolution":{"observed_at":"2026-08-10T00:58:35.179065Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:58:35.169725Z","title":"Large scale gan training for high fidelity natural image synthesis","venue":null,"work_id":"5c6ddfb6-11c3-44ab-a1c8-f8901e4ad8d7","year":2018},"citing_paper":{"arxiv_id":"2501.18033","last_updated":"2025-01-29T22:42:05Z","snapshot_observed_at":"2026-08-11T17:55:22.401089Z","submitted_at":"2025-01-29T22:42:05Z","title":"Generative AI for Vision: A Comprehensive Study of Frameworks and Applications","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T00:58:34.702396Z"},"links":{"citing_paper":"/paper/2501.18033"},"observation_digest":"sha256:3f25e5e21c28f929c752903cfaf78aa532752a7606f9015b41253f5abef48aa3","observation_id":"47df9200-8030-464c-971d-e9ef9060208e","resolution":{"observed_at":"2026-08-10T00:58:35.172215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09800","last_updated":"2023-01-18T17:31:52Z","snapshot_observed_at":"2026-08-06T07:25:23.651829Z","submitted_at":"2022-11-17T18:58:43Z","title":"InstructPix2Pix: Learning to Follow Image Editing Instructions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09800","snapshot_observed_at":"2026-08-10T00:58:34.705487Z","title":"Instructpix2pix: Learning to follow image editing instructions","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.18033","last_updated":"2025-01-29T22:42:05Z","snapshot_observed_at":"2026-08-11T17:55:22.401089Z","submitted_at":"2025-01-29T22:42:05Z","title":"Generative AI for Vision: A Comprehensive Study of Frameworks and Applications","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T00:58:34.705487Z"},"links":{"cited_paper":"/paper/2211.09800","citing_paper":"/paper/2501.18033"},"observation_digest":"sha256:b0ab3b26d09a0a7ba38ae430a02c0316314dd4e676c4687c5a2ef5ce3ea6a3fe","observation_id":"bd8ef176-e7e2-47f5-ac8b-04c75b823e8c","resolution":{"observed_at":"2026-08-10T00:58:34.705487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:58:35.162249Z","title":"Janus-pro: Unified multi- modal understanding and generation with data and model scaling, 2025","venue":null,"work_id":"74297dd3-a3ad-4c3c-96e2-f6f61d7428fd","year":2025},"citing_paper":{"arxiv_id":"2501.18033","last_updated":"2025-01-29T22:42:05Z","snapshot_observed_at":"2026-08-11T17:55:22.401089Z","submitted_at":"2025-01-29T22:42:05Z","title":"Generative AI for Vision: A Comprehensive Study of Frameworks and Applications","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T00:58:34.709136Z"},"links":{"citing_paper":"/paper/2501.18033"},"observation_digest":"sha256:69cfbf8d2239b822b04ce275f8332d656df2ce764ec0a4bb9a7c213963ed4463","observation_id":"59bde726-9b30-4c72-ba35-2e3082da7b75","resolution":{"observed_at":"2026-08-10T00:58:35.165106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02954","last_updated":"2024-01-05T18:59:13Z","snapshot_observed_at":"2026-08-10T17:03:38.042994Z","submitted_at":"2024-01-05T18:59:13Z","title":"DeepSeek LLM: Scaling Open-Source Language Models with Longtermism","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02954","snapshot_observed_at":"2026-08-10T00:58:34.712026Z","title":"Deepseek llm: Scaling open-source language models with longtermism","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18033","last_updated":"2025-01-29T22:42:05Z","snapshot_observed_at":"2026-08-11T17:55:22.401089Z","submitted_at":"2025-01-29T22:42:05Z","title":"Generative AI for Vision: A Comprehensive Study of Frameworks and Applications","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T00:58:34.712026Z"},"links":{"cited_paper":"/paper/2401.02954","citing_paper":"/paper/2501.18033"},"observation_digest":"sha256:88746f7453223f1aa62826deb1a2580563f3eaf4bba981dde1766d11e128108d","observation_id":"deff94b1-4d1e-4efa-b91a-c0e873fdc51f","resolution":{"observed_at":"2026-08-10T00:58:34.712026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-10T00:58:34.715177Z","title":"Bert: Pre-training of deep bidirectional transformers for language un- derstanding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.18033","last_updated":"2025-01-29T22:42:05Z","snapshot_observed_at":"2026-08-11T17:55:22.401089Z","submitted_at":"2025-01-29T22:42:05Z","title":"Generative AI for Vision: A Comprehensive Study of Frameworks and Applications","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T00:58:34.715177Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2501.18033"},"observation_digest":"sha256:e79657b66ca11051beed4faa0b148ba3a27f901d79104aa517d8b1ed64b28a27","observation_id":"a79ad726-70a4-483f-bcd1-f5c9c8574a6a","resolution":{"observed_at":"2026-08-10T00:58:34.715177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:58:35.154428Z","title":"Diffusion models beat gans on image synthesis","venue":null,"work_id":"af8f0876-2436-4e12-a2c2-55479057f930","year":2021},"citing_paper":{"arxiv_id":"2501.18033","last_updated":"2025-01-29T22:42:05Z","snapshot_observed_at":"2026-08-11T17:55:22.401089Z","submitted_at":"2025-01-29T22:42:05Z","title":"Generative AI for Vision: A Comprehensive Study of Frameworks and Applications","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T00:58:34.718452Z"},"links":{"citing_paper":"/paper/2501.18033"},"observation_digest":"sha256:8833ff4c3653dd935bf9dfb619fafc3c951fa4fb77621630e696975f3e5bab29","observation_id":"ff498176-8f78-4915-b3c2-e93c5bf47d5b","resolution":{"observed_at":"2026-08-10T00:58:35.157469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01618","last_updated":"2022-08-02T17:50:36Z","snapshot_observed_at":"2026-08-02T23:40:32.342515Z","submitted_at":"2022-08-02T17:50:36Z","title":"An Image is Worth One Word: Personalizing Text-to-Image Generation using Textual Inversion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01618","snapshot_observed_at":"2026-08-10T00:58:34.721287Z","title":"An image is worth one word: Personalizing text-to-image generation using textual inversion","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.18033","last_updated":"2025-01-29T22:42:05Z","snapshot_observed_at":"2026-08-11T17:55:22.401089Z","submitted_at":"2025-01-29T22:42:05Z","title":"Generative AI for Vision: A Comprehensive Study of Frameworks and Applications","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T00:58:34.721287Z"},"links":{"cited_paper":"/paper/2208.01618","citing_paper":"/paper/2501.18033"},"observation_digest":"sha256:c926c823f39ce6f96a68fbe4917b4ad5a81920fea26ddf8cd08da829ab8e08fa","observation_id":"eee4d4c0-061c-4bae-ade4-b0d68f96a9fb","resolution":{"observed_at":"2026-08-10T00:58:34.721287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:58:35.146816Z","title":"Gen- erative adversarial nets","venue":null,"work_id":"306752e6-f36b-4ee6-b726-9eb787c29be1","year":2014},"citing_paper":{"arxiv_id":"2501.18033","last_updated":"2025-01-29T22:42:05Z","snapshot_observed_at":"2026-08-11T17:55:22.401089Z","submitted_at":"2025-01-29T22:42:05Z","title":"Generative AI for Vision: A Comprehensive Study of Frameworks and Applications","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T00:58:34.724461Z"},"links":{"citing_paper":"/paper/2501.18033"},"observation_digest":"sha256:a85f535fd4290042092d8e942285182cae09f6118533dbc532800fab04f3d5e9","observation_id":"1c75d7f9-d1a3-4517-8078-41958eb99500","resolution":{"observed_at":"2026-08-10T00:58:35.149557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:58:35.138943Z","title":"beta-vae: Learning basic visual concepts with a constrained variational framework","venue":null,"work_id":"5f5286c8-3ec0-471b-a2e5-a2e62c85923a","year":2017},"citing_paper":{"arxiv_id":"2501.18033","last_updated":"2025-01-29T22:42:05Z","snapshot_observed_at":"2026-08-11T17:55:22.401089Z","submitted_at":"2025-01-29T22:42:05Z","title":"Generative AI for Vision: A Comprehensive Study of Frameworks and Applications","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T00:58:34.727223Z"},"links":{"citing_paper":"/paper/2501.18033"},"observation_digest":"sha256:2095170434d1d518e7c8fccafd96fd6f7af363ca591500c9151763260ee9d3d1","observation_id":"cc8e0ba7-c444-46ed-b1ca-c2ceae6a765a","resolution":{"observed_at":"2026-08-10T00:58:35.141884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:58:35.131025Z","title":"Denoising diffusion proba- bilistic models, 2020","venue":null,"work_id":"92b2013a-f323-4570-85ff-9154b7e51dae","year":2020},"citing_paper":{"arxiv_id":"2501.18033","last_updated":"2025-01-29T22:42:05Z","snapshot_observed_at":"2026-08-11T17:55:22.401089Z","submitted_at":"2025-01-29T22:42:05Z","title":"Generative AI for Vision: A Comprehensive Study of Frameworks and Applications","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T00:58:34.729907Z"},"links":{"citing_paper":"/paper/2501.18033"},"observation_digest":"sha256:42467fc41b3bb134dd7c3e45c4949feec0bd95e04fedcbd4b9d1fa6f509e60ae","observation_id":"a9a2a6ff-9ab1-437d-accf-91485c90f2d5","resolution":{"observed_at":"2026-08-10T00:58:35.133922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1703.02370","last_updated":"2017-03-07T13:31:41Z","snapshot_observed_at":"2026-07-06T05:32:41.054089Z","submitted_at":"2017-03-07T13:31:41Z","title":"Crossing Over from Attractive to Repulsive Interactions in a Tunneling Bosonic Josephson Junction","version":1},"cited_work":{"arxiv_id":"1703.02370","doi":null,"metadata_source":"pith","pith_arxiv_id":"1703.02370","snapshot_observed_at":"2026-08-10T00:58:34.929760Z","title":"Crossing Over from Attractive to Repulsive Interactions in a Tunneling Bosonic Josephson Junction","venue":"quant-ph","work_id":"00c01ee4-7428-4528-b111-b4d9a203c713","year":2017},"citing_paper":{"arxiv_id":"2501.18033","last_updated":"2025-01-29T22:42:05Z","snapshot_observed_at":"2026-08-11T17:55:22.401089Z","submitted_at":"2025-01-29T22:42:05Z","title":"Generative AI for Vision: A Comprehensive Study of Frameworks and Applications","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T00:58:34.732557Z"},"links":{"cited_paper":"/paper/1703.02370","citing_paper":"/paper/2501.18033"},"observation_digest":"sha256:e31a0df3712dc22998f71f55a5853c291a9b44a11eef0f33209d1ddd87308ded","observation_id":"06d2087a-f973-4cde-973b-0cba28826119","resolution":{"observed_at":"2026-08-10T00:58:34.932558Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:58:35.122576Z","title":"Image- to-image translation with conditional adversarial networks","venue":null,"work_id":"8b13eb45-96f9-4cb1-be84-f74ddc1d1215","year":2017},"citing_paper":{"arxiv_id":"2501.18033","last_updated":"2025-01-29T22:42:05Z","snapshot_observed_at":"2026-08-11T17:55:22.401089Z","submitted_at":"2025-01-29T22:42:05Z","title":"Generative AI for Vision: A Comprehensive Study of Frameworks and Applications","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T00:58:34.734991Z"},"links":{"citing_paper":"/paper/2501.18033"},"observation_digest":"sha256:a6144006b22fb454ed19617d6fc6a3423d1641d1ba9b67e6ea89e3000d40b8de","observation_id":"ce86ef70-141e-4ee5-9746-78c31da1afe0","resolution":{"observed_at":"2026-08-10T00:58:35.125739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:58:35.113885Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision","venue":null,"work_id":"ca256fd8-08f7-4354-9ca3-0bb4c4e82091","year":2021},"citing_paper":{"arxiv_id":"2501.18033","last_updated":"2025-01-29T22:42:05Z","snapshot_observed_at":"2026-08-11T17:55:22.401089Z","submitted_at":"2025-01-29T22:42:05Z","title":"Generative AI for Vision: A Comprehensive Study of Frameworks and Applications","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T00:58:34.737166Z"},"links":{"citing_paper":"/paper/2501.18033"},"observation_digest":"sha256:5423f6f3ca580e261e8a75fdf1e5fb75f48b7d228ebf26bb2adff27929da247d","observation_id":"0a5f1184-abc0-4e8e-81b3-c905ef66edf7","resolution":{"observed_at":"2026-08-10T00:58:35.117067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:58:35.105739Z","title":"A style-based generator architecture for generative adversarial networks","venue":null,"work_id":"ea2da9fd-0ce3-43a4-9fbb-271b38f57301","year":2019},"citing_paper":{"arxiv_id":"2501.18033","last_updated":"2025-01-29T22:42:05Z","snapshot_observed_at":"2026-08-11T17:55:22.401089Z","submitted_at":"2025-01-29T22:42:05Z","title":"Generative AI for Vision: A Comprehensive Study of Frameworks and Applications","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T00:58:34.739502Z"},"links":{"citing_paper":"/paper/2501.18033"},"observation_digest":"sha256:5499284a63295b71ed5c76345a2d277a4b8ffff438a9f4b39faf4bb18406df39","observation_id":"2399bf68-2f4b-4cbd-9e0e-b97d3eaea610","resolution":{"observed_at":"2026-08-10T00:58:35.108844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-10T00:58:34.741892Z","title":"Auto-encoding variational bayes","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2501.18033","last_updated":"2025-01-29T22:42:05Z","snapshot_observed_at":"2026-08-11T17:55:22.401089Z","submitted_at":"2025-01-29T22:42:05Z","title":"Generative AI for Vision: A Comprehensive Study of Frameworks and Applications","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T00:58:34.741892Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2501.18033"},"observation_digest":"sha256:87824340500963a6fc5abc6bc0aef9110fb0eded39c692f9170fbc420ae48b46","observation_id":"498897eb-c13c-43f6-87a0-c1e2857edc16","resolution":{"observed_at":"2026-08-10T00:58:34.741892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.11942","last_updated":"2020-02-09T03:00:18Z","snapshot_observed_at":"2026-07-06T08:24:44.631342Z","submitted_at":"2019-09-26T07:06:13Z","title":"ALBERT: A Lite BERT for Self-supervised Learning of Language Representations","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.11942","snapshot_observed_at":"2026-08-10T00:58:34.744152Z","title":"Albert: A lite bert for self-supervised learning of language representations","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2501.18033","last_updated":"2025-01-29T22:42:05Z","snapshot_observed_at":"2026-08-11T17:55:22.401089Z","submitted_at":"2025-01-29T22:42:05Z","title":"Generative AI for Vision: A Comprehensive Study of Frameworks and Applications","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T00:58:34.744152Z"},"links":{"cited_paper":"/paper/1909.11942","citing_paper":"/paper/2501.18033"},"observation_digest":"sha256:0d2b4126742c15d35f265238bab85dd1f100563c37e0cc4e338add043eea100b","observation_id":"9c5a2deb-4c78-475d-ae9f-b11e1182d931","resolution":{"observed_at":"2026-08-10T00:58:34.744152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:58:35.097634Z","title":"Photo-realistic single image super-resolution using a generative adversarial network","venue":null,"work_id":"beb5d35f-980d-4b71-bbd3-8c28df728886","year":2017},"citing_paper":{"arxiv_id":"2501.18033","last_updated":"2025-01-29T22:42:05Z","snapshot_observed_at":"2026-08-11T17:55:22.401089Z","submitted_at":"2025-01-29T22:42:05Z","title":"Generative AI for Vision: A Comprehensive Study of Frameworks and Applications","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T00:58:34.747039Z"},"links":{"citing_paper":"/paper/2501.18033"},"observation_digest":"sha256:08bb0d0d4ac8ad36c19a60a86fd920203129812fa651878d0de345ce50a01b22","observation_id":"bcc98676-e740-4654-af3f-0db467b66fdc","resolution":{"observed_at":"2026-08-10T00:58:35.100613Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-09T08:39:37.884261Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-10T00:58:34.749290Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.18033","last_updated":"2025-01-29T22:42:05Z","snapshot_observed_at":"2026-08-11T17:55:22.401089Z","submitted_at":"2025-01-29T22:42:05Z","title":"Generative AI for Vision: A Comprehensive Study of Frameworks and Applications","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T00:58:34.749290Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2501.18033"},"observation_digest":"sha256:6c5e3d063da6af25a8bcd07055691519f7fc8a510e3a4c27875cc13c816bdc8b","observation_id":"f10a70b6-0a7e-48e1-a9ce-3aae5d7e0072","resolution":{"observed_at":"2026-08-10T00:58:34.749290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-07-31T22:31:37.910868Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-10T00:58:34.751895Z","title":"Roberta: A robustly optimized bert pretraining approach","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2501.18033","last_updated":"2025-01-29T22:42:05Z","snapshot_observed_at":"2026-08-11T17:55:22.401089Z","submitted_at":"2025-01-29T22:42:05Z","title":"Generative AI for Vision: A Comprehensive Study of Frameworks and Applications","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T00:58:34.751895Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2501.18033"},"observation_digest":"sha256:50cc72bfd27bd52526b8e596863339d50070483ccb59b90fff229bb317121d88","observation_id":"58abe1d0-0a2c-450a-a940-9e27201acb4b","resolution":{"observed_at":"2026-08-10T00:58:34.751895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.09368","last_updated":"2018-01-28T09:25:08Z","snapshot_observed_at":"2026-07-06T05:44:20.438335Z","submitted_at":"2017-05-25T21:29:07Z","title":"Pose Guided Person Image Generation","version":6},"cited_work":{"arxiv_id":"1705.09368","doi":null,"metadata_source":"pith","pith_arxiv_id":"1705.09368","snapshot_observed_at":"2026-08-10T00:58:34.890386Z","title":"Pose Guided Person Image Generation","venue":"cs.CV","work_id":"492474e3-ecc2-42b2-8260-a0954e810f6a","year":2017},"citing_paper":{"arxiv_id":"2501.18033","last_updated":"2025-01-29T22:42:05Z","snapshot_observed_at":"2026-08-11T17:55:22.401089Z","submitted_at":"2025-01-29T22:42:05Z","title":"Generative AI for Vision: A Comprehensive Study of Frameworks and Applications","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T00:58:34.754341Z"},"links":{"cited_paper":"/paper/1705.09368","citing_paper":"/paper/2501.18033"},"observation_digest":"sha256:b7a6ccc653006560d45eb32a6aa658501f65c64adab832b632bd53d4f2ac2c33","observation_id":"f1087d8a-57ca-4dd4-a066-1a2b3adb23ca","resolution":{"observed_at":"2026-08-10T00:58:34.894875Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1511.05644","last_updated":"2016-05-25T00:17:45Z","snapshot_observed_at":"2026-08-10T09:13:56.872366Z","submitted_at":"2015-11-18T02:32:39Z","title":"Adversarial Autoencoders","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.05644","snapshot_observed_at":"2026-08-10T00:58:34.756659Z","title":"Adversarial autoencoders","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.18033","last_updated":"2025-01-29T22:42:05Z","snapshot_observed_at":"2026-08-11T17:55:22.401089Z","submitted_at":"2025-01-29T22:42:05Z","title":"Generative AI for Vision: A Comprehensive Study of Frameworks and Applications","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T00:58:34.756659Z"},"links":{"cited_paper":"/paper/1511.05644","citing_paper":"/paper/2501.18033"},"observation_digest":"sha256:b3291c3712c6ec4c18c74447b02a6c98d89df900b00de9fd1fd48d0424ebb840","observation_id":"aacc12b8-a051-4268-9037-612cbc9589fc","resolution":{"observed_at":"2026-08-10T00:58:34.756659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.08453","last_updated":"2023-03-20T10:52:26Z","snapshot_observed_at":"2026-07-31T21:11:02.534986Z","submitted_at":"2023-02-16T17:56:08Z","title":"T2I-Adapter: Learning Adapters to Dig out More Controllable Ability for Text-to-Image Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.08453","snapshot_observed_at":"2026-08-10T00:58:34.758894Z","title":"T2i-adapter: Learning adapters to dig out more controllable ability for text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.18033","last_updated":"2025-01-29T22:42:05Z","snapshot_observed_at":"2026-08-11T17:55:22.401089Z","submitted_at":"2025-01-29T22:42:05Z","title":"Generative AI for Vision: A Comprehensive Study of Frameworks and Applications","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T00:58:34.758894Z"},"links":{"cited_paper":"/paper/2302.08453","citing_paper":"/paper/2501.18033"},"observation_digest":"sha256:74879a986d5a44184014696690498a3af0cb30a06f2455507de352bad7335b41","observation_id":"0d1db8f7-12a9-4f40-8e7c-bee10848611c","resolution":{"observed_at":"2026-08-10T00:58:34.758894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:58:35.090402Z","title":"Neural discrete representation learning","venue":null,"work_id":"96e05a1f-9e6a-4d00-98fd-931f2fa15140","year":2017},"citing_paper":{"arxiv_id":"2501.18033","last_updated":"2025-01-29T22:42:05Z","snapshot_observed_at":"2026-08-11T17:55:22.401089Z","submitted_at":"2025-01-29T22:42:05Z","title":"Generative AI for Vision: A Comprehensive Study of Frameworks and Applications","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T00:58:34.761392Z"},"links":{"citing_paper":"/paper/2501.18033"},"observation_digest":"sha256:1aca39d28e8fe8e822352e1a2aefb8236942ffcff788745f40eb5280324fd7b0","observation_id":"bd822de9-8a7f-444f-aa8a-88b819e37529","resolution":{"observed_at":"2026-08-10T00:58:35.092954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:58:35.083557Z","title":"Gpt-4 technical report, 2024","venue":null,"work_id":"633ba371-a0b1-4029-aba3-07b86d8f9544","year":2024},"citing_paper":{"arxiv_id":"2501.18033","last_updated":"2025-01-29T22:42:05Z","snapshot_observed_at":"2026-08-11T17:55:22.401089Z","submitted_at":"2025-01-29T22:42:05Z","title":"Generative AI for Vision: A Comprehensive Study of Frameworks and Applications","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T00:58:34.764132Z"},"links":{"citing_paper":"/paper/2501.18033"},"observation_digest":"sha256:903e8ea9781722d3588c285c4cd901da3872bc221e21504aff9fc4bff4b0d06c","observation_id":"6fc63e86-f7e9-4889-8bf6-d2c9043b81f7","resolution":{"observed_at":"2026-08-10T00:58:35.085913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-10T00:58:34.767272Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.18033","last_updated":"2025-01-29T22:42:05Z","snapshot_observed_at":"2026-08-11T17:55:22.401089Z","submitted_at":"2025-01-29T22:42:05Z","title":"Generative AI for Vision: A Comprehensive Study of Frameworks and Applications","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T00:58:34.767272Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2501.18033"},"observation_digest":"sha256:7885ec220fdffaa6bd9edad2742f2fa7d6f5e311b7decd781add26025ab2df46","observation_id":"2bb465e6-bd40-4f5f-b612-8f8ea1ef5184","resolution":{"observed_at":"2026-08-10T00:58:34.767272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:58:34.770411Z","title":"Learning transferable visual models from natural language supervision, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.18033","last_updated":"2025-01-29T22:42:05Z","snapshot_observed_at":"2026-08-11T17:55:22.401089Z","submitted_at":"2025-01-29T22:42:05Z","title":"Generative AI for Vision: A Comprehensive Study of Frameworks and Applications","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T00:58:34.770411Z"},"links":{"citing_paper":"/paper/2501.18033"},"observation_digest":"sha256:c277ce01abb0cf59dcce9ca300e66f25a8d22ccb3c2b9347539873aef279b8a8","observation_id":"d621d4b5-2a13-4fba-81e9-b249644f0887","resolution":{"observed_at":"2026-08-10T00:58:34.770411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:58:35.071817Z","title":"Language models are unsupervised multitask learn- ers","venue":null,"work_id":"33272e6c-8a89-461d-a2ef-107189f1fcf3","year":2019},"citing_paper":{"arxiv_id":"2501.18033","last_updated":"2025-01-29T22:42:05Z","snapshot_observed_at":"2026-08-11T17:55:22.401089Z","submitted_at":"2025-01-29T22:42:05Z","title":"Generative AI for Vision: A Comprehensive Study of Frameworks and Applications","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T00:58:34.773091Z"},"links":{"citing_paper":"/paper/2501.18033"},"observation_digest":"sha256:7b32ee3d1e51d151333b771f5d961fbaf2bba917981bea3d1d43d07e3ddd7031","observation_id":"fac6f3a2-b451-4e97-8d72-0c20ac03f842","resolution":{"observed_at":"2026-08-10T00:58:35.074752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:58:34.776430Z","title":"Hierarchical text-conditional image generation with clip latents, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.18033","last_updated":"2025-01-29T22:42:05Z","snapshot_observed_at":"2026-08-11T17:55:22.401089Z","submitted_at":"2025-01-29T22:42:05Z","title":"Generative AI for Vision: A Comprehensive Study of Frameworks and Applications","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T00:58:34.776430Z"},"links":{"citing_paper":"/paper/2501.18033"},"observation_digest":"sha256:0b6ca1b9c706f84233a6a9082b2f8df6fa212e95fab5a659646d90c6b837ae6f","observation_id":"76670c2e-5d86-4030-8ce0-a403033a60ca","resolution":{"observed_at":"2026-08-10T00:58:34.776430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:58:35.059812Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"766784ce-142c-4aa6-993d-b436f29c6a2b","year":2022},"citing_paper":{"arxiv_id":"2501.18033","last_updated":"2025-01-29T22:42:05Z","snapshot_observed_at":"2026-08-11T17:55:22.401089Z","submitted_at":"2025-01-29T22:42:05Z","title":"Generative AI for Vision: A Comprehensive Study of Frameworks and Applications","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T00:58:34.779184Z"},"links":{"citing_paper":"/paper/2501.18033"},"observation_digest":"sha256:6a85262f6baea3622e644857b91764f9af82dc3dcf1dd7dd00e0e23f9d57139d","observation_id":"3e7e4d89-555a-487c-9449-06c44ac4f311","resolution":{"observed_at":"2026-08-10T00:58:35.062743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:58:34.781836Z","title":"High-resolution image synthesis with latent diffusion models, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.18033","last_updated":"2025-01-29T22:42:05Z","snapshot_observed_at":"2026-08-11T17:55:22.401089Z","submitted_at":"2025-01-29T22:42:05Z","title":"Generative AI for Vision: A Comprehensive Study of Frameworks and Applications","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T00:58:34.781836Z"},"links":{"citing_paper":"/paper/2501.18033"},"observation_digest":"sha256:b3522d0f97af69102885d411ef82d79f75a5448397703bc10e0e6e0b1987c987","observation_id":"2c379c1c-6b4f-4061-843d-f6ad3dccef73","resolution":{"observed_at":"2026-08-10T00:58:34.781836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.12242","last_updated":"2023-03-15T17:52:27Z","snapshot_observed_at":"2026-07-06T13:45:31.237782Z","submitted_at":"2022-08-25T17:45:49Z","title":"DreamBooth: Fine Tuning Text-to-Image Diffusion Models for Subject-Driven Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.12242","snapshot_observed_at":"2026-08-10T00:58:34.784678Z","title":"Dreambooth: Fine tuning text-to-image diffusion models for subject-driven generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.18033","last_updated":"2025-01-29T22:42:05Z","snapshot_observed_at":"2026-08-11T17:55:22.401089Z","submitted_at":"2025-01-29T22:42:05Z","title":"Generative AI for Vision: A Comprehensive Study of Frameworks and Applications","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T00:58:34.784678Z"},"links":{"cited_paper":"/paper/2208.12242","citing_paper":"/paper/2501.18033"},"observation_digest":"sha256:3af667e85660ffda3356f77d9465682f6766b3b3b6177c68230570054c301e59","observation_id":"fb485ef0-41f9-4fe4-8eee-63a8642eb62b","resolution":{"observed_at":"2026-08-10T00:58:34.784678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:58:35.047201Z","title":"Sara Mahdavi, Rapha Gontijo Lopes, Tim Salimans, Jonathan Ho, David J Fleet, and Mohammad Norouzi","venue":null,"work_id":"79a5fa5d-9f10-46a5-9926-3a5975eb6e6f","year":2022},"citing_paper":{"arxiv_id":"2501.18033","last_updated":"2025-01-29T22:42:05Z","snapshot_observed_at":"2026-08-11T17:55:22.401089Z","submitted_at":"2025-01-29T22:42:05Z","title":"Generative AI for Vision: A Comprehensive Study of Frameworks and Applications","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T00:58:34.787670Z"},"links":{"citing_paper":"/paper/2501.18033"},"observation_digest":"sha256:dc6560ad2e9770a8f97fa7473083e077b2de65e29a8d543f769575c99a7fe127","observation_id":"19aa62e2-cd83-4882-ab65-ecef2649dc3b","resolution":{"observed_at":"2026-08-10T00:58:35.050439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:58:35.038879Z","title":"Imagen: Text-to- image diffusion models with large pretrained models.Advances in Neural Information Processing Systems, 35, 2022","venue":null,"work_id":"5bef1233-3a1d-4fcb-990c-c73e9f8b262c","year":2022},"citing_paper":{"arxiv_id":"2501.18033","last_updated":"2025-01-29T22:42:05Z","snapshot_observed_at":"2026-08-11T17:55:22.401089Z","submitted_at":"2025-01-29T22:42:05Z","title":"Generative AI for Vision: A Comprehensive Study of Frameworks and Applications","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T00:58:34.790562Z"},"links":{"citing_paper":"/paper/2501.18033"},"observation_digest":"sha256:67eaf3554bdde5fcadf4916a4bacca95b960087fb668d84e28d5ee5f56ebf309","observation_id":"d24e3f00-1a77-4052-b0fe-e81466be31c9","resolution":{"observed_at":"2026-08-10T00:58:35.042198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04482","last_updated":"2022-03-29T18:22:08Z","snapshot_observed_at":"2026-08-09T02:02:12.962602Z","submitted_at":"2021-12-08T18:59:16Z","title":"FLAVA: A Foundational Language And Vision Alignment Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.04482","snapshot_observed_at":"2026-08-10T00:58:34.793240Z","title":"Flava: A foundational language and vision alignment model","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.18033","last_updated":"2025-01-29T22:42:05Z","snapshot_observed_at":"2026-08-11T17:55:22.401089Z","submitted_at":"2025-01-29T22:42:05Z","title":"Generative AI for Vision: A Comprehensive Study of Frameworks and Applications","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T00:58:34.793240Z"},"links":{"cited_paper":"/paper/2112.04482","citing_paper":"/paper/2501.18033"},"observation_digest":"sha256:36678a8df65d0a4f36a86008c2a460757bcade5ff7848800cd56287aaff544ae","observation_id":"2a4ad4ab-efd4-4071-9b1f-d0bd22dd724d","resolution":{"observed_at":"2026-08-10T00:58:34.793240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:58:35.030615Z","title":"Learning structured output representation using deep conditional generative models","venue":null,"work_id":"74b1591d-ae2b-4746-bfb3-24e37a54e4ce","year":2015},"citing_paper":{"arxiv_id":"2501.18033","last_updated":"2025-01-29T22:42:05Z","snapshot_observed_at":"2026-08-11T17:55:22.401089Z","submitted_at":"2025-01-29T22:42:05Z","title":"Generative AI for Vision: A Comprehensive Study of Frameworks and Applications","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T00:58:34.796222Z"},"links":{"citing_paper":"/paper/2501.18033"},"observation_digest":"sha256:6a58caec99eef4c87c2f133c2dfde81aa60b8cf311a50d7f961d894a84d425a3","observation_id":"a80f88a3-8c7c-4a77-a1c4-aaa534016149","resolution":{"observed_at":"2026-08-10T00:58:35.033918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:58:35.021263Z","title":"Ladder variational autoencoders","venue":null,"work_id":"3cfffc71-c54b-47bb-b7a2-4dd3f6c3843e","year":2016},"citing_paper":{"arxiv_id":"2501.18033","last_updated":"2025-01-29T22:42:05Z","snapshot_observed_at":"2026-08-11T17:55:22.401089Z","submitted_at":"2025-01-29T22:42:05Z","title":"Generative AI for Vision: A Comprehensive Study of Frameworks and Applications","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T00:58:34.799047Z"},"links":{"citing_paper":"/paper/2501.18033"},"observation_digest":"sha256:5095ef6716dad68d7fba6c34dd20f5657490126116c64f28cedd37ed7170aec8","observation_id":"0936282b-17bd-4ddc-b3b8-95b893c7af5b","resolution":{"observed_at":"2026-08-10T00:58:35.024310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01469","last_updated":"2023-05-31T06:17:10Z","snapshot_observed_at":"2026-07-06T14:58:02.852672Z","submitted_at":"2023-03-02T18:30:16Z","title":"Consistency Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.01469","snapshot_observed_at":"2026-08-10T00:58:34.801763Z","title":"Consistency models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.18033","last_updated":"2025-01-29T22:42:05Z","snapshot_observed_at":"2026-08-11T17:55:22.401089Z","submitted_at":"2025-01-29T22:42:05Z","title":"Generative AI for Vision: A Comprehensive Study of Frameworks and Applications","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T00:58:34.801763Z"},"links":{"cited_paper":"/paper/2303.01469","citing_paper":"/paper/2501.18033"},"observation_digest":"sha256:6c543a0329def0848b1e9f3ad58f6e417f93203246f61e812b88520beef6ae3c","observation_id":"085aa662-56ef-4f77-b426-c197fb0dc97c","resolution":{"observed_at":"2026-08-10T00:58:34.801763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:58:35.012663Z","title":"Score-based generative modeling through stochastic differential equations","venue":null,"work_id":"26e46821-b127-4e33-8510-b77dca983084","year":2021},"citing_paper":{"arxiv_id":"2501.18033","last_updated":"2025-01-29T22:42:05Z","snapshot_observed_at":"2026-08-11T17:55:22.401089Z","submitted_at":"2025-01-29T22:42:05Z","title":"Generative AI for Vision: A Comprehensive Study of Frameworks and Applications","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T00:58:34.804768Z"},"links":{"citing_paper":"/paper/2501.18033"},"observation_digest":"sha256:9fa6b0394ced5886ff19d273034aa40de6498bb259a96b63b129668756c9c4aa","observation_id":"f2f8f35e-b839-4bd0-a964-adc4af66232f","resolution":{"observed_at":"2026-08-10T00:58:35.015841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:58:35.004231Z","title":"Llama 2: Open foundation and fine-tuned chat models, 2023","venue":null,"work_id":"b971bd36-ef33-487f-81fd-81d95d43c037","year":2023},"citing_paper":{"arxiv_id":"2501.18033","last_updated":"2025-01-29T22:42:05Z","snapshot_observed_at":"2026-08-11T17:55:22.401089Z","submitted_at":"2025-01-29T22:42:05Z","title":"Generative AI for Vision: A Comprehensive Study of Frameworks and Applications","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T00:58:34.807014Z"},"links":{"citing_paper":"/paper/2501.18033"},"observation_digest":"sha256:a9415f104612e7dee21402f67e6af550efb3ca58267178159af547acfcfd4fd5","observation_id":"83c0e36e-ce39-4a08-ba39-a7fa2e028f30","resolution":{"observed_at":"2026-08-10T00:58:35.007420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:58:34.995384Z","title":"Diffusion models: A comprehensive survey of methods and applications, 2024","venue":null,"work_id":"825aca6e-7e67-41bc-afe3-d01b320c3ea3","year":2024},"citing_paper":{"arxiv_id":"2501.18033","last_updated":"2025-01-29T22:42:05Z","snapshot_observed_at":"2026-08-11T17:55:22.401089Z","submitted_at":"2025-01-29T22:42:05Z","title":"Generative AI for Vision: A Comprehensive Study of Frameworks and Applications","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T00:58:34.809250Z"},"links":{"citing_paper":"/paper/2501.18033"},"observation_digest":"sha256:49fee5952d2aeee52051b5d9a1f4c75d7555a734ab62284eb41a1615639b53a7","observation_id":"37c5718c-6765-48c1-94bf-70d0fb120a0b","resolution":{"observed_at":"2026-08-10T00:58:34.998570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01917","last_updated":"2022-06-14T00:48:04Z","snapshot_observed_at":"2026-08-10T15:05:25.558818Z","submitted_at":"2022-05-04T07:01:14Z","title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01917","snapshot_observed_at":"2026-08-10T00:58:34.811605Z","title":"Coca: Contrastive captioners are image-text foun- dation models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.18033","last_updated":"2025-01-29T22:42:05Z","snapshot_observed_at":"2026-08-11T17:55:22.401089Z","submitted_at":"2025-01-29T22:42:05Z","title":"Generative AI for Vision: A Comprehensive Study of Frameworks and Applications","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T00:58:34.811605Z"},"links":{"cited_paper":"/paper/2205.01917","citing_paper":"/paper/2501.18033"},"observation_digest":"sha256:4e68feb935a8e26c8921a5c5a1dfa6f02fde34fefbb3dc371c580bc25de976b0","observation_id":"8f252cd2-c921-47f5-bcde-66c5e87bd54d","resolution":{"observed_at":"2026-08-10T00:58:34.811605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.05543","last_updated":"2023-11-26T22:26:12Z","snapshot_observed_at":"2026-08-04T15:27:22.366324Z","submitted_at":"2023-02-10T23:12:37Z","title":"Adding Conditional Control to Text-to-Image Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.05543","snapshot_observed_at":"2026-08-10T00:58:34.814064Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.18033","last_updated":"2025-01-29T22:42:05Z","snapshot_observed_at":"2026-08-11T17:55:22.401089Z","submitted_at":"2025-01-29T22:42:05Z","title":"Generative AI for Vision: A Comprehensive Study of Frameworks and Applications","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T00:58:34.814064Z"},"links":{"cited_paper":"/paper/2302.05543","citing_paper":"/paper/2501.18033"},"observation_digest":"sha256:96c14954e4d2bafd7e28f693f0b995d7466a46633d863b60c12d373d2a93149b","observation_id":"00492d8a-8c24-4082-984e-6e01e45f1b21","resolution":{"observed_at":"2026-08-10T00:58:34.814064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:58:34.986038Z","title":"Unpaired image-to-image translation using cycle-consistent adversarial networks","venue":null,"work_id":"0f3ef099-d87d-4974-af13-52cbfd4259a6","year":2017},"citing_paper":{"arxiv_id":"2501.18033","last_updated":"2025-01-29T22:42:05Z","snapshot_observed_at":"2026-08-11T17:55:22.401089Z","submitted_at":"2025-01-29T22:42:05Z","title":"Generative AI for Vision: A Comprehensive Study of Frameworks and Applications","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T00:58:34.816586Z"},"links":{"citing_paper":"/paper/2501.18033"},"observation_digest":"sha256:984bdb925b81754ebe87c5b8c5222616b5ed4d26cf2fc43c6d22b8ab132d3da7","observation_id":"d3769457-8161-4e98-ba7c-02fa9e82d4c1","resolution":{"observed_at":"2026-08-10T00:58:34.989782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.18033","last_updated":"2025-01-29T22:42:05Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-11T17:55:22.401089Z","submitted_at":"2025-01-29T22:42:05Z","title":"Generative AI for Vision: A Comprehensive Study of Frameworks and Applications"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":21,"verified_exact":2,"verified_fuzzy":24},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 2 inbound Pith citation observations for arXiv:2501.18033."}