{"as_of":"2026-08-21T06:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b9b8ad6fbbc37b923f2d666d2bd23365978ed16ec27dfc24d22f1a913ce34d37","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T18:40:28.695737Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.07674/citation-record","integrity":"/paper/2412.07674/integrity","json":"/paper/2412.07674/citation-record.json","paper":"/paper/2412.07674"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:28.499186Z","title":"Conceptual 12M: Pushing web-scale image-text pre-training to recognize long-tail visual concepts","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.07674","last_updated":"2024-12-10T17:02:58Z","snapshot_observed_at":"2026-08-19T14:07:54.499957Z","submitted_at":"2024-12-10T17:02:58Z","title":"FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:28.499186Z"},"links":{"citing_paper":"/paper/2412.07674"},"observation_digest":"sha256:b0d24e084c299d26c7d7f1d5886efa96cf09d7c3e2197e8eb2eeaeb39acd268e","observation_id":"123556f4-da29-4584-b1b4-f614e181b247","resolution":{"observed_at":"2026-08-11T18:40:28.499186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-11T18:40:28.504786Z","title":"Pixart- α: Fast training of diffusion transformer for photorealistic text-to-image synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.07674","last_updated":"2024-12-10T17:02:58Z","snapshot_observed_at":"2026-08-19T14:07:54.499957Z","submitted_at":"2024-12-10T17:02:58Z","title":"FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:28.504786Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2412.07674"},"observation_digest":"sha256:aaef7892f2842c30fa70756f2c62214c4627378c94ac25f05ac556dd68d53116","observation_id":"0ff369a0-008e-4ccb-9ceb-584132a5fc03","resolution":{"observed_at":"2026-08-11T18:40:28.504786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","snapshot_observed_at":"2026-08-20T12:02:18.410348Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04692","snapshot_observed_at":"2026-08-11T18:40:28.510156Z","title":"Pixart- \\sigma: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.07674","last_updated":"2024-12-10T17:02:58Z","snapshot_observed_at":"2026-08-19T14:07:54.499957Z","submitted_at":"2024-12-10T17:02:58Z","title":"FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:28.510156Z"},"links":{"cited_paper":"/paper/2403.04692","citing_paper":"/paper/2412.07674"},"observation_digest":"sha256:d3d562bfd7ad65e8343f1c2c8028f965be27427d03f74cb56e0771c5a31c84f5","observation_id":"3831a5ed-78d5-482f-ac7b-fe1ef7bb6c3b","resolution":{"observed_at":"2026-08-11T18:40:28.510156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.05252","last_updated":"2024-01-10T16:27:38Z","snapshot_observed_at":"2026-08-16T14:28:28.987831Z","submitted_at":"2024-01-10T16:27:38Z","title":"PIXART-{\\delta}: Fast and Controllable Image Generation with Latent Consistency Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.05252","snapshot_observed_at":"2026-08-11T18:40:28.516313Z","title":"Pixart-{\\delta}: Fast and controllable image generation with latent consistency models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.07674","last_updated":"2024-12-10T17:02:58Z","snapshot_observed_at":"2026-08-19T14:07:54.499957Z","submitted_at":"2024-12-10T17:02:58Z","title":"FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:28.516313Z"},"links":{"cited_paper":"/paper/2401.05252","citing_paper":"/paper/2412.07674"},"observation_digest":"sha256:83d4f67a979b12a67528a99a734c6b511af9257a796baa2279b7dfdeb2831f68","observation_id":"8f187c7c-a289-4bb8-bd3c-f2b7dc9ce093","resolution":{"observed_at":"2026-08-11T18:40:28.516313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09481","last_updated":"2024-05-08T03:21:34Z","snapshot_observed_at":"2026-08-16T15:15:13.894611Z","submitted_at":"2023-07-18T17:59:02Z","title":"AnyDoor: Zero-shot Object-level Image Customization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09481","snapshot_observed_at":"2026-08-11T18:40:28.521603Z","title":"Anydoor: Zero-shot object-level image customization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07674","last_updated":"2024-12-10T17:02:58Z","snapshot_observed_at":"2026-08-19T14:07:54.499957Z","submitted_at":"2024-12-10T17:02:58Z","title":"FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:28.521603Z"},"links":{"cited_paper":"/paper/2307.09481","citing_paper":"/paper/2412.07674"},"observation_digest":"sha256:9bf70aa51e63ceb4a72d612f6278060e8a75f329bf0a0ae893aba79d3f06db07","observation_id":"7b8bfe93-837a-418a-bc33-7275e61f4e0b","resolution":{"observed_at":"2026-08-11T18:40:28.521603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.00946","last_updated":"2021-12-16T17:05:46Z","snapshot_observed_at":"2026-08-18T09:43:50.068709Z","submitted_at":"2021-08-02T14:46:46Z","title":"StyleGAN-NADA: CLIP-Guided Domain Adaptation of Image Generators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.00946","snapshot_observed_at":"2026-08-11T18:40:28.526087Z","title":"Stylegan-nada: Clip-guided domain adaptation of image generators","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.07674","last_updated":"2024-12-10T17:02:58Z","snapshot_observed_at":"2026-08-19T14:07:54.499957Z","submitted_at":"2024-12-10T17:02:58Z","title":"FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:28.526087Z"},"links":{"cited_paper":"/paper/2108.00946","citing_paper":"/paper/2412.07674"},"observation_digest":"sha256:68c6a8a45883e426ea7051478107e67b9d94569207232466d3f3a55701d35606","observation_id":"863a72db-3cd7-46a1-b4b5-434cef1123f4","resolution":{"observed_at":"2026-08-11T18:40:28.526087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02133","last_updated":"2024-01-11T13:51:40Z","snapshot_observed_at":"2026-08-20T18:13:47.660492Z","submitted_at":"2023-12-04T18:55:35Z","title":"Style Aligned Image Generation via Shared Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02133","snapshot_observed_at":"2026-08-11T18:40:28.531192Z","title":"Style aligned image generation via shared attention","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07674","last_updated":"2024-12-10T17:02:58Z","snapshot_observed_at":"2026-08-19T14:07:54.499957Z","submitted_at":"2024-12-10T17:02:58Z","title":"FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:28.531192Z"},"links":{"cited_paper":"/paper/2312.02133","citing_paper":"/paper/2412.07674"},"observation_digest":"sha256:c5013da96c5d441d922b1d00bb79e9862e465d806a2a32dddf78295171ebe097","observation_id":"2ccdbf6d-f69d-4b6c-8f86-c6fbff59a759","resolution":{"observed_at":"2026-08-11T18:40:28.531192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.11239","last_updated":"2020-12-16T21:15:05Z","snapshot_observed_at":"2026-08-10T05:21:27.485481Z","submitted_at":"2020-06-19T17:24:44Z","title":"Denoising Diffusion Probabilistic Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.11239","snapshot_observed_at":"2026-08-11T18:40:28.536843Z","title":null,"venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2412.07674","last_updated":"2024-12-10T17:02:58Z","snapshot_observed_at":"2026-08-19T14:07:54.499957Z","submitted_at":"2024-12-10T17:02:58Z","title":"FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:28.536843Z"},"links":{"cited_paper":"/paper/2006.11239","citing_paper":"/paper/2412.07674"},"observation_digest":"sha256:c91c526ba0ad73e404f6c8f4a8e77609bb15de59789184b6f8d4111faaaf79e9","observation_id":"00ffe697-6b61-4661-9d87-a2c0b969387c","resolution":{"observed_at":"2026-08-11T18:40:28.536843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17117","last_updated":"2024-06-13T06:37:20Z","snapshot_observed_at":"2026-08-17T07:05:18.024386Z","submitted_at":"2023-11-28T12:27:15Z","title":"Animate Anyone: Consistent and Controllable Image-to-Video Synthesis for Character Animation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17117","snapshot_observed_at":"2026-08-11T18:40:28.542539Z","title":"Animate anyone: Consistent and controllable image-to-video synthesis for character animation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07674","last_updated":"2024-12-10T17:02:58Z","snapshot_observed_at":"2026-08-19T14:07:54.499957Z","submitted_at":"2024-12-10T17:02:58Z","title":"FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:28.542539Z"},"links":{"cited_paper":"/paper/2311.17117","citing_paper":"/paper/2412.07674"},"observation_digest":"sha256:8057369ba1a5d156c6b930951b9e6fa41867427b75a7cabc68152767b1cc28c4","observation_id":"cb74d589-ca20-4309-8e8c-7bdeda643d97","resolution":{"observed_at":"2026-08-11T18:40:28.542539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:29.305186Z","title":"U-dit tts: U-diffusion vision transformer for text-to-speech","venue":null,"work_id":"797db0b8-6234-43b0-9003-eeb68a6519e6","year":2023},"citing_paper":{"arxiv_id":"2412.07674","last_updated":"2024-12-10T17:02:58Z","snapshot_observed_at":"2026-08-19T14:07:54.499957Z","submitted_at":"2024-12-10T17:02:58Z","title":"FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:28.547520Z"},"links":{"citing_paper":"/paper/2412.07674"},"observation_digest":"sha256:9d29070c4719ffcdb69660088bdda3ed62c263925ef190aed981e0ea7242d59f","observation_id":"ee60112f-92dc-49b4-9d06-eee352350115","resolution":{"observed_at":"2026-08-11T18:40:29.310868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:29.286731Z","title":"Shamma, Michael S","venue":null,"work_id":"71df72f4-04d0-421e-8b8d-53d07f39a07d","year":2016},"citing_paper":{"arxiv_id":"2412.07674","last_updated":"2024-12-10T17:02:58Z","snapshot_observed_at":"2026-08-19T14:07:54.499957Z","submitted_at":"2024-12-10T17:02:58Z","title":"FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:28.552766Z"},"links":{"citing_paper":"/paper/2412.07674"},"observation_digest":"sha256:cd5653330b203457b3a0d859965da09e2bd8879ce1d3f7426f50e929846f3fff","observation_id":"1ae46ef0-fa04-483a-81af-f9acdb0f6f2e","resolution":{"observed_at":"2026-08-11T18:40:29.291723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:29.270386Z","title":"Multi-concept customization of text-to-image diffusion","venue":null,"work_id":"019d1462-369f-4396-823a-a60d167db303","year":2023},"citing_paper":{"arxiv_id":"2412.07674","last_updated":"2024-12-10T17:02:58Z","snapshot_observed_at":"2026-08-19T14:07:54.499957Z","submitted_at":"2024-12-10T17:02:58Z","title":"FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:28.557545Z"},"links":{"citing_paper":"/paper/2412.07674"},"observation_digest":"sha256:c64ffe8917f12f8d07f4878ca5c497d7180abdfb4d0a8d3f08544fcc1beeec25","observation_id":"4a3be902-907e-43e8-8b10-89e8cb51d104","resolution":{"observed_at":"2026-08-11T18:40:29.275691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14720","last_updated":"2023-06-22T02:36:06Z","snapshot_observed_at":"2026-08-17T19:30:41.517390Z","submitted_at":"2023-05-24T04:51:04Z","title":"BLIP-Diffusion: Pre-trained Subject Representation for Controllable Text-to-Image Generation and Editing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14720","snapshot_observed_at":"2026-08-11T18:40:28.562905Z","title":"Blip-diffusion: Pre-trained subject representation for controllable text-to-image generation and editing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07674","last_updated":"2024-12-10T17:02:58Z","snapshot_observed_at":"2026-08-19T14:07:54.499957Z","submitted_at":"2024-12-10T17:02:58Z","title":"FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:28.562905Z"},"links":{"cited_paper":"/paper/2305.14720","citing_paper":"/paper/2412.07674"},"observation_digest":"sha256:0d3d7138ff8262d36d4a86c689a77a4fc2342fab6fda080c0abe1f0b88876ec8","observation_id":"52ed3e26-d7ca-40ec-8e86-bb4bbf858261","resolution":{"observed_at":"2026-08-11T18:40:28.562905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:28.567813Z","title":"Playground v2.5: Three insights towards enhancing aesthetic quality in text-to-image generation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.07674","last_updated":"2024-12-10T17:02:58Z","snapshot_observed_at":"2026-08-19T14:07:54.499957Z","submitted_at":"2024-12-10T17:02:58Z","title":"FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:28.567813Z"},"links":{"citing_paper":"/paper/2412.07674"},"observation_digest":"sha256:98cec5e150ac8a7cb04152978ec0ade3c1baa69799ba7d5d8a049590ee842f4d","observation_id":"d85635d7-304a-4021-ba62-35a13fa7fdc7","resolution":{"observed_at":"2026-08-11T18:40:28.567813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:29.243523Z","title":null,"venue":null,"work_id":"5af1282a-0b03-4c03-b1d0-93c24a6441b9","year":2023},"citing_paper":{"arxiv_id":"2412.07674","last_updated":"2024-12-10T17:02:58Z","snapshot_observed_at":"2026-08-19T14:07:54.499957Z","submitted_at":"2024-12-10T17:02:58Z","title":"FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:28.572408Z"},"links":{"citing_paper":"/paper/2412.07674"},"observation_digest":"sha256:006903930289bd3a98399e981d2b9a1895ab84fb8b66723af99eab44754685ff","observation_id":"f17c1609-96ed-4d8b-b483-8b2210fd039c","resolution":{"observed_at":"2026-08-11T18:40:29.248425Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:28.577187Z","title":"Belongie, James Hays, Pietro Perona, Deva Ramanan, Piotr Dollár, and C","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.07674","last_updated":"2024-12-10T17:02:58Z","snapshot_observed_at":"2026-08-19T14:07:54.499957Z","submitted_at":"2024-12-10T17:02:58Z","title":"FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:28.577187Z"},"links":{"citing_paper":"/paper/2412.07674"},"observation_digest":"sha256:c7744b94180dae4c7f4a52d1e9b275df6818eb0c2b7dab98fd9fceff3b180ec3","observation_id":"c93b783a-afec-4fa9-8d06-78d19c1b7d97","resolution":{"observed_at":"2026-08-11T18:40:28.577187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03003","last_updated":"2022-09-07T08:59:55Z","snapshot_observed_at":"2026-07-06T13:49:40.974495Z","submitted_at":"2022-09-07T08:59:55Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.03003","snapshot_observed_at":"2026-08-11T18:40:28.581999Z","title":"Flow straight and fast: Learning to generate and transfer data with rectified flow","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.07674","last_updated":"2024-12-10T17:02:58Z","snapshot_observed_at":"2026-08-19T14:07:54.499957Z","submitted_at":"2024-12-10T17:02:58Z","title":"FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:28.581999Z"},"links":{"cited_paper":"/paper/2209.03003","citing_paper":"/paper/2412.07674"},"observation_digest":"sha256:f514216652e87d53a82bac442761e4c9170ab0abf732e43ef6a80153c373a124","observation_id":"9693c1af-da83-4fe8-b793-fe24540a19d5","resolution":{"observed_at":"2026-08-11T18:40:28.581999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:28.586866Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07674","last_updated":"2024-12-10T17:02:58Z","snapshot_observed_at":"2026-08-19T14:07:54.499957Z","submitted_at":"2024-12-10T17:02:58Z","title":"FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:28.586866Z"},"links":{"citing_paper":"/paper/2412.07674"},"observation_digest":"sha256:cff1792c8fd80ffc8b64263af13bc12a403dda91d74650ebc3b793a6e1a58597","observation_id":"422a4f50-5edd-478c-8bac-5b206c302428","resolution":{"observed_at":"2026-08-11T18:40:28.586866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:29.205085Z","title":"Deadiff: An efficient stylization diffusion model with disentangled representations","venue":null,"work_id":"8c7ee7c1-11e8-466d-a5fb-2db59942ef06","year":2024},"citing_paper":{"arxiv_id":"2412.07674","last_updated":"2024-12-10T17:02:58Z","snapshot_observed_at":"2026-08-19T14:07:54.499957Z","submitted_at":"2024-12-10T17:02:58Z","title":"FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:28.591514Z"},"links":{"citing_paper":"/paper/2412.07674"},"observation_digest":"sha256:2218f4bf89eec448f493387cf1ec253805f4973e84ba682333a9736d3cd0cfe4","observation_id":"216f4f28-7531-4740-9a23-672717f2a722","resolution":{"observed_at":"2026-08-11T18:40:29.210503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:28.596189Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.07674","last_updated":"2024-12-10T17:02:58Z","snapshot_observed_at":"2026-08-19T14:07:54.499957Z","submitted_at":"2024-12-10T17:02:58Z","title":"FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:28.596189Z"},"links":{"citing_paper":"/paper/2412.07674"},"observation_digest":"sha256:a55a7a330d187eeb6a0e4f01cf6128cfdc40891b30672e2962df98d1225d9635","observation_id":"ccc476a0-c9ee-4095-a455-d4415c888ed7","resolution":{"observed_at":"2026-08-11T18:40:28.596189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:28.600751Z","title":"Blattmann, Dominik Lorenz, Patrick Esser, and Björn Ommer","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.07674","last_updated":"2024-12-10T17:02:58Z","snapshot_observed_at":"2026-08-19T14:07:54.499957Z","submitted_at":"2024-12-10T17:02:58Z","title":"FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:28.600751Z"},"links":{"citing_paper":"/paper/2412.07674"},"observation_digest":"sha256:49dc770c51a70c91d3d334ee4e9e2e4d0ebb3c40a8a825079132971e148b1f85","observation_id":"e5e969db-e17b-436c-a2de-0852b9b6d7cb","resolution":{"observed_at":"2026-08-11T18:40:28.600751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:28.604965Z","title":"U-net: Convolutional networks for biomedical image segmentation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.07674","last_updated":"2024-12-10T17:02:58Z","snapshot_observed_at":"2026-08-19T14:07:54.499957Z","submitted_at":"2024-12-10T17:02:58Z","title":"FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:28.604965Z"},"links":{"citing_paper":"/paper/2412.07674"},"observation_digest":"sha256:f66214d5cc15c92f8b55b8b3ac6d1b04bbc50a11dc8af33a1575040afec8712a","observation_id":"6ebed150-4ce5-419f-b01f-0c2aa596df0e","resolution":{"observed_at":"2026-08-11T18:40:28.604965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:28.609185Z","title":"Dreambooth: Fine tuning text-to-image diffusion models for subject-driven generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07674","last_updated":"2024-12-10T17:02:58Z","snapshot_observed_at":"2026-08-19T14:07:54.499957Z","submitted_at":"2024-12-10T17:02:58Z","title":"FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:28.609185Z"},"links":{"citing_paper":"/paper/2412.07674"},"observation_digest":"sha256:12488537da9079802ca46ee391c6bbdb9ab16171592c673eea7a13b757958a0f","observation_id":"61ca893c-e1a0-4c43-85ff-737fdbf7775d","resolution":{"observed_at":"2026-08-11T18:40:28.609185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:28.613283Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.07674","last_updated":"2024-12-10T17:02:58Z","snapshot_observed_at":"2026-08-19T14:07:54.499957Z","submitted_at":"2024-12-10T17:02:58Z","title":"FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:28.613283Z"},"links":{"citing_paper":"/paper/2412.07674"},"observation_digest":"sha256:a00e195bf2fbb840ac4f37d9f9d3b980bffdc8ada4e2d651dc62cdaa8e59c327","observation_id":"3f9604d0-f297-4230-a940-f6b8aac25916","resolution":{"observed_at":"2026-08-11T18:40:28.613283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:29.139890Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models","venue":null,"work_id":"19e8a172-6142-46ac-b00a-484104225a1c","year":2022},"citing_paper":{"arxiv_id":"2412.07674","last_updated":"2024-12-10T17:02:58Z","snapshot_observed_at":"2026-08-19T14:07:54.499957Z","submitted_at":"2024-12-10T17:02:58Z","title":"FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:28.617342Z"},"links":{"citing_paper":"/paper/2412.07674"},"observation_digest":"sha256:28fc3a83ddbafa2a7d1974719ecbc8764e023cfded15cfd90cc30621225d09c5","observation_id":"651bbf4a-c436-4f06-8e1b-fa117c04f349","resolution":{"observed_at":"2026-08-11T18:40:29.144412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:29.123097Z","title":"Conceptual captions: A cleaned, hypernymed, image alt-text dataset for automatic image captioning","venue":null,"work_id":"2cd386f6-e7b7-4876-b493-48c1beddfd2b","year":2018},"citing_paper":{"arxiv_id":"2412.07674","last_updated":"2024-12-10T17:02:58Z","snapshot_observed_at":"2026-08-19T14:07:54.499957Z","submitted_at":"2024-12-10T17:02:58Z","title":"FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:28.621422Z"},"links":{"citing_paper":"/paper/2412.07674"},"observation_digest":"sha256:f5a0dc5768760d4da24734de24e0f141d4ab723a98f2b0db1eead38ebb4c01ab","observation_id":"a05873d1-6f36-49be-b0b8-f554d1766e88","resolution":{"observed_at":"2026-08-11T18:40:29.128749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00983","last_updated":"2023-06-01T17:59:51Z","snapshot_observed_at":"2026-08-19T11:34:19.126799Z","submitted_at":"2023-06-01T17:59:51Z","title":"StyleDrop: Text-to-Image Generation in Any Style","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00983","snapshot_observed_at":"2026-08-11T18:40:28.630681Z","title":"Styledrop: Text-to-image generation in any style","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07674","last_updated":"2024-12-10T17:02:58Z","snapshot_observed_at":"2026-08-19T14:07:54.499957Z","submitted_at":"2024-12-10T17:02:58Z","title":"FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:28.630681Z"},"links":{"cited_paper":"/paper/2306.00983","citing_paper":"/paper/2412.07674"},"observation_digest":"sha256:683ddc39eb29e913cd15a3dc826479b381d13493c1d5f63e63f5f17045eb541b","observation_id":"8f304f1c-82e2-459a-b33e-a519b0734e1b","resolution":{"observed_at":"2026-08-11T18:40:28.630681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.00932","last_updated":"2022-12-05T05:11:31Z","snapshot_observed_at":"2026-08-16T16:11:34.747479Z","submitted_at":"2022-12-02T02:15:13Z","title":"ObjectStitch: Generative Object Compositing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.00932","snapshot_observed_at":"2026-08-11T18:40:28.635347Z","title":"Cohen, Brian L","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.07674","last_updated":"2024-12-10T17:02:58Z","snapshot_observed_at":"2026-08-19T14:07:54.499957Z","submitted_at":"2024-12-10T17:02:58Z","title":"FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:28.635347Z"},"links":{"cited_paper":"/paper/2212.00932","citing_paper":"/paper/2412.07674"},"observation_digest":"sha256:3620bdb175d3f61e433a062dae66d658b795b3a78a3927bc76109a5347cefd3a","observation_id":"2da18837-135c-4929-9a28-78edfa457b65","resolution":{"observed_at":"2026-08-11T18:40:28.635347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:29.106177Z","title":"Shamma, Gerald Friedland, Benjamin Elizalde, Karl S","venue":null,"work_id":"4bb95c87-f95b-4c45-aa97-9b6efb4dd792","year":2015},"citing_paper":{"arxiv_id":"2412.07674","last_updated":"2024-12-10T17:02:58Z","snapshot_observed_at":"2026-08-19T14:07:54.499957Z","submitted_at":"2024-12-10T17:02:58Z","title":"FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:28.641437Z"},"links":{"citing_paper":"/paper/2412.07674"},"observation_digest":"sha256:c33b0606c81c30aca15576f0e2668ad5af3f40e8e9d69edeeb65eb7dacc0eab0","observation_id":"fe3ea982-b90d-422d-8fe9-1316ba354f9b","resolution":{"observed_at":"2026-08-11T18:40:29.111710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.01770","last_updated":"2024-10-30T17:05:17Z","snapshot_observed_at":"2026-08-19T14:07:18.191023Z","submitted_at":"2023-09-04T19:16:46Z","title":"StyleAdapter: A Unified Stylized Image Generation Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.01770","snapshot_observed_at":"2026-08-11T18:40:28.646066Z","title":"Styleadapter: A single-pass lora-free model for stylized image generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07674","last_updated":"2024-12-10T17:02:58Z","snapshot_observed_at":"2026-08-19T14:07:54.499957Z","submitted_at":"2024-12-10T17:02:58Z","title":"FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:28.646066Z"},"links":{"cited_paper":"/paper/2309.01770","citing_paper":"/paper/2412.07674"},"observation_digest":"sha256:408d80f114a4ad6c9d10816c3cfd1906566dd43b39ead637239827664d11af01","observation_id":"d536c86b-0386-46ca-afe7-22e8f05b567b","resolution":{"observed_at":"2026-08-11T18:40:28.646066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.14896","last_updated":"2023-07-06T11:53:19Z","snapshot_observed_at":"2026-08-16T16:20:53.427900Z","submitted_at":"2022-10-26T17:54:20Z","title":"DiffusionDB: A Large-scale Prompt Gallery Dataset for Text-to-Image Generative Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.14896","snapshot_observed_at":"2026-08-11T18:40:28.651519Z","title":"Wang, Evan Montoya, David Munechika, Haoyang Yang, Benjamin Hoover, and Duen Horng Chau","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.07674","last_updated":"2024-12-10T17:02:58Z","snapshot_observed_at":"2026-08-19T14:07:54.499957Z","submitted_at":"2024-12-10T17:02:58Z","title":"FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:28.651519Z"},"links":{"cited_paper":"/paper/2210.14896","citing_paper":"/paper/2412.07674"},"observation_digest":"sha256:06fa885350a27071bcf5775760212bd2a8874eddb4a5e4c30c59e7b11ac992ec","observation_id":"a4da1109-0fb9-447d-b887-b96fd195529d","resolution":{"observed_at":"2026-08-11T18:40:28.651519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:29.089230Z","title":"Paint by example: Exemplar-based image editing with diffusion models","venue":null,"work_id":"53733d2f-9709-4d37-853f-820f18c26758","year":2023},"citing_paper":{"arxiv_id":"2412.07674","last_updated":"2024-12-10T17:02:58Z","snapshot_observed_at":"2026-08-19T14:07:54.499957Z","submitted_at":"2024-12-10T17:02:58Z","title":"FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:28.656683Z"},"links":{"citing_paper":"/paper/2412.07674"},"observation_digest":"sha256:69085daf59c4c161074e9433800f00714df1f6ccac66f1c3738750a3330e4337","observation_id":"041610ed-f5e5-4402-bbb4-8719d5116c90","resolution":{"observed_at":"2026-08-11T18:40:29.094528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:28.661388Z","title":"Ip-adapter: Text compatible image prompt adapter for text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07674","last_updated":"2024-12-10T17:02:58Z","snapshot_observed_at":"2026-08-19T14:07:54.499957Z","submitted_at":"2024-12-10T17:02:58Z","title":"FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:28.661388Z"},"links":{"citing_paper":"/paper/2412.07674"},"observation_digest":"sha256:d3e172fcd43d9c346946b862f575211180774ef12d523258b9522dd4c1bf592f","observation_id":"5ed338e7-4fed-45c1-8132-cb2f399d53d4","resolution":{"observed_at":"2026-08-11T18:40:28.661388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:29.062673Z","title":"[sks]” denoting the placeholder for subjects that might fit into the sentence. Prompts are created by replacing “[sks]","venue":null,"work_id":"b2dc7f32-58a3-4281-b764-a4468664c371","year":2023},"citing_paper":{"arxiv_id":"2412.07674","last_updated":"2024-12-10T17:02:58Z","snapshot_observed_at":"2026-08-19T14:07:54.499957Z","submitted_at":"2024-12-10T17:02:58Z","title":"FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:28.666224Z"},"links":{"citing_paper":"/paper/2412.07674"},"observation_digest":"sha256:a76b395145998274a5d6c22fafa5fc560600287dc4ed113656c62c96f8b0b75b","observation_id":"70c85eb5-c59a-49d0-bf37-6a2b39ba0f7a","resolution":{"observed_at":"2026-08-11T18:40:29.067960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:29.046984Z","title":"stage pyrotechnics","venue":null,"work_id":"ca182681-12a7-42c3-a575-d9cbd4bf7ed7","year":2024},"citing_paper":{"arxiv_id":"2412.07674","last_updated":"2024-12-10T17:02:58Z","snapshot_observed_at":"2026-08-19T14:07:54.499957Z","submitted_at":"2024-12-10T17:02:58Z","title":"FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:28.671798Z"},"links":{"citing_paper":"/paper/2412.07674"},"observation_digest":"sha256:c6f0ac3b1ae83b30aa463b677c4681cf54b1cf9284e15cccfefe0978d15ab691","observation_id":"56324b7f-e934-4a48-8e70-a7b506e1b063","resolution":{"observed_at":"2026-08-11T18:40:29.051486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:29.031487Z","title":null,"venue":null,"work_id":"83747126-fa32-4dc2-bdd0-6bbe3ce2a57b","year":null},"citing_paper":{"arxiv_id":"2412.07674","last_updated":"2024-12-10T17:02:58Z","snapshot_observed_at":"2026-08-19T14:07:54.499957Z","submitted_at":"2024-12-10T17:02:58Z","title":"FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:28.677687Z"},"links":{"citing_paper":"/paper/2412.07674"},"observation_digest":"sha256:5722d676b34c25bf9e065e14cbf146d6b46e5e03d948f0e0d0cdfba0c81dd4a3","observation_id":"8294fc73-8938-49d1-9adb-debd7f9146bb","resolution":{"observed_at":"2026-08-11T18:40:29.036486Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:28.682116Z","title":"(a) Did you state the full set of assumptions of all theoretical results? [N/A] (b) Did you include complete proofs of all theoretical results? [N/A]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.07674","last_updated":"2024-12-10T17:02:58Z","snapshot_observed_at":"2026-08-19T14:07:54.499957Z","submitted_at":"2024-12-10T17:02:58Z","title":"FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:28.682116Z"},"links":{"citing_paper":"/paper/2412.07674"},"observation_digest":"sha256:ec83813695ee6bbd320b94348ec22a972dcc0bac03b47ad64de71289f7a258e1","observation_id":"9d513c26-c9e2-45d8-8d86-742407f48343","resolution":{"observed_at":"2026-08-11T18:40:28.682116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:29.003565Z","title":"for benchmarks)","venue":null,"work_id":"ef874ecb-b9ac-4ffb-aecc-7bd7bc6cb322","year":null},"citing_paper":{"arxiv_id":"2412.07674","last_updated":"2024-12-10T17:02:58Z","snapshot_observed_at":"2026-08-19T14:07:54.499957Z","submitted_at":"2024-12-10T17:02:58Z","title":"FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:28.686288Z"},"links":{"citing_paper":"/paper/2412.07674"},"observation_digest":"sha256:8de181c70af7fba605bdd2a5395d3d33d456cd9df6b9311891b24df62f4fb15c","observation_id":"e54029d3-36a3-42db-9116-a33dccc2d946","resolution":{"observed_at":"2026-08-11T18:40:29.008646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:28.985387Z","title":"(a) If your work uses existing assets, did you cite the creators? [Yes] See reference","venue":null,"work_id":"8b3fb5f9-5866-46b7-a879-7809ec3fe278","year":null},"citing_paper":{"arxiv_id":"2412.07674","last_updated":"2024-12-10T17:02:58Z","snapshot_observed_at":"2026-08-19T14:07:54.499957Z","submitted_at":"2024-12-10T17:02:58Z","title":"FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:28.690731Z"},"links":{"citing_paper":"/paper/2412.07674"},"observation_digest":"sha256:f1c1b79dbe1687c73c19b51cecbe1dd10f7b78ec9532a1fdf24394056c869d8c","observation_id":"fe5b9adb-78f5-4ca2-8113-15d386a35bcb","resolution":{"observed_at":"2026-08-11T18:40:28.991422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:28.967054Z","title":null,"venue":null,"work_id":"e9cfab7e-5e9a-44a8-bcf7-52eca22ee50b","year":null},"citing_paper":{"arxiv_id":"2412.07674","last_updated":"2024-12-10T17:02:58Z","snapshot_observed_at":"2026-08-19T14:07:54.499957Z","submitted_at":"2024-12-10T17:02:58Z","title":"FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:28.695737Z"},"links":{"citing_paper":"/paper/2412.07674"},"observation_digest":"sha256:988c05f547e4d7fd0309d344e1c229a6dfc4499de8f258b0e735edbf53c6a098","observation_id":"39f542e4-a151-4afb-9ea6-13d56ebcf22d","resolution":{"observed_at":"2026-08-11T18:40:28.973554Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.07674","last_updated":"2024-12-10T17:02:58Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-19T14:07:54.499957Z","submitted_at":"2024-12-10T17:02:58Z","title":"FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":0,"verified_fuzzy":12},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 0 inbound Pith citation observations for arXiv:2412.07674."}