{"as_of":"2026-08-10T18:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d5c83e58876f4cb2c6c7550ee9e01c2595df55670a53fe18c039bd3d1ff67382","coverage":[{"denominator":16,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:50:21.910265Z","state":"measured"},{"denominator":17,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":17,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T16:11:10.598413Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T09:11:02.341076Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.05300","last_updated":"2025-07-07T01:18:40Z","snapshot_observed_at":"2026-08-10T08:50:00.509260Z","submitted_at":"2025-07-07T01:18:40Z","title":"Structured Captions Improve Prompt Adherence in Text-to-Image Models (Re-LAION-Caption 19M)","version":1},"cited_work":{"arxiv_id":"2507.05300","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.05300","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"fed020c3-36d6-49cb-b52c-7bf04df6df78","year":2025},"citing_paper":{"arxiv_id":"2604.12357","last_updated":"2026-04-14T06:47:47Z","snapshot_observed_at":"2026-07-06T23:00:32.607699Z","submitted_at":"2026-04-14T06:47:47Z","title":"ReflectCAP: Detailed Image Captioning with Reflective Memory","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T16:11:10.598413Z"},"links":{"cited_paper":"/paper/2507.05300","citing_paper":"/paper/2604.12357"},"observation_digest":"sha256:0131b59ee3fe7e63c177bf6a505d820010996a943783bf5d1f5005290dc968fa","observation_id":"d7a5f4ea-e055-4ebe-8ff9-309d4390ee0a","resolution":{"observed_at":"2026-05-11T09:11:02.344304Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.05300/citation-record","integrity":"/paper/2507.05300/integrity","json":"/paper/2507.05300/citation-record.json","paper":"/paper/2507.05300"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2305.20088","last_updated":"2023-10-28T08:46:13Z","snapshot_observed_at":"2026-08-05T05:10:35.003635Z","submitted_at":"2023-05-31T17:59:04Z","title":"Improving CLIP Training with Language Rewrites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20088","snapshot_observed_at":"2026-08-06T19:50:20.447559Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05300","last_updated":"2025-07-07T01:18:40Z","snapshot_observed_at":"2026-08-10T08:50:00.509260Z","submitted_at":"2025-07-07T01:18:40Z","title":"Structured Captions Improve Prompt Adherence in Text-to-Image Models (Re-LAION-Caption 19M)","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:20.447559Z"},"links":{"cited_paper":"/paper/2305.20088","citing_paper":"/paper/2507.05300"},"observation_digest":"sha256:90a949cf3481ccaa54bbb8957b31cfc99cf0d45c2d9574c265d0d9dde822cf06","observation_id":"f885d8ca-7074-4cd9-913c-7f22f0cab520","resolution":{"observed_at":"2026-08-06T19:50:20.447559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-06T19:50:20.713255Z","title":"Lai, Z., Zhang, H., Zhang, B., Wu, W., Bai, H., Tim- ofeev, A., Du, X., Gan, Z., Shan, J., Chuah, C.-N., Yang, Y ., and Cao, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05300","last_updated":"2025-07-07T01:18:40Z","snapshot_observed_at":"2026-08-10T08:50:00.509260Z","submitted_at":"2025-07-07T01:18:40Z","title":"Structured Captions Improve Prompt Adherence in Text-to-Image Models (Re-LAION-Caption 19M)","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:20.713255Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2507.05300"},"observation_digest":"sha256:8697549ebc4d6f6788abaa537989b226db16d791f10698ee26d4d1bd378daebd","observation_id":"88973b45-3c6a-4501-b3b5-3226af531b7e","resolution":{"observed_at":"2026-08-06T19:50:20.713255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07699","last_updated":"2024-03-13T22:27:08Z","snapshot_observed_at":"2026-08-07T22:28:20.122152Z","submitted_at":"2023-10-11T17:49:13Z","title":"VeCLIP: Improving CLIP Training via Visual-enriched Captions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07699","snapshot_observed_at":"2026-08-06T19:50:20.826610Z","title":"Li, H., Xu, M., Zhan, Y ., Mu, S., Li, J., Cheng, K., Chen, Y ., Chen, T., Ye, M., Wang, J., and Zhu, S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05300","last_updated":"2025-07-07T01:18:40Z","snapshot_observed_at":"2026-08-10T08:50:00.509260Z","submitted_at":"2025-07-07T01:18:40Z","title":"Structured Captions Improve Prompt Adherence in Text-to-Image Models (Re-LAION-Caption 19M)","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:20.826610Z"},"links":{"cited_paper":"/paper/2310.07699","citing_paper":"/paper/2507.05300"},"observation_digest":"sha256:3e8c89acb21390272a797a8470b45e57dd2106046d9d297690bad3f8b2b89392","observation_id":"94b48528-2d7f-4432-b992-52d9ef528a87","resolution":{"observed_at":"2026-08-06T19:50:20.826610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08478","last_updated":"2024-06-18T11:47:26Z","snapshot_observed_at":"2026-07-06T18:29:49.284504Z","submitted_at":"2024-06-12T17:59:07Z","title":"What If We Recaption Billions of Web Images with LLaMA-3?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08478","snapshot_observed_at":"2026-08-06T19:50:21.065213Z","title":"Liao, M., Wan, Z., Yao, C., Chen, K., and Bai, X","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05300","last_updated":"2025-07-07T01:18:40Z","snapshot_observed_at":"2026-08-10T08:50:00.509260Z","submitted_at":"2025-07-07T01:18:40Z","title":"Structured Captions Improve Prompt Adherence in Text-to-Image Models (Re-LAION-Caption 19M)","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:21.065213Z"},"links":{"cited_paper":"/paper/2406.08478","citing_paper":"/paper/2507.05300"},"observation_digest":"sha256:9d65416e40a53db415b82cc2fb6ec3c894339a1cd72c1b20276f6d4c79c0560b","observation_id":"1e30366c-0674-43ef-9b1e-88fd609466fe","resolution":{"observed_at":"2026-08-06T19:50:21.065213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-06T19:50:21.319649Z","title":"Raffel, C., Shazeer, N., Roberts, A., Lee, K., Narang, S., Matena, M., Zhou, Y ., Li, W., and Liu, P","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05300","last_updated":"2025-07-07T01:18:40Z","snapshot_observed_at":"2026-08-10T08:50:00.509260Z","submitted_at":"2025-07-07T01:18:40Z","title":"Structured Captions Improve Prompt Adherence in Text-to-Image Models (Re-LAION-Caption 19M)","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:21.319649Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2507.05300"},"observation_digest":"sha256:97a120d37c5622e56d30f442b25d1ac454d2660ac6732df8478e5fe6295615cb","observation_id":"566015e5-ed23-4701-8800-34684a5e14bf","resolution":{"observed_at":"2026-08-06T19:50:21.319649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.10683","last_updated":"2023-09-19T15:14:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-10-23T17:37:36Z","title":"Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.10683","snapshot_observed_at":"2026-08-06T19:50:21.432622Z","title":null,"venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2507.05300","last_updated":"2025-07-07T01:18:40Z","snapshot_observed_at":"2026-08-10T08:50:00.509260Z","submitted_at":"2025-07-07T01:18:40Z","title":"Structured Captions Improve Prompt Adherence in Text-to-Image Models (Re-LAION-Caption 19M)","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:21.432622Z"},"links":{"cited_paper":"/paper/1910.10683","citing_paper":"/paper/2507.05300"},"observation_digest":"sha256:e78a27ebb211ce3019f2db29c4dc856488b7b57117792ac608775256dd4a7443","observation_id":"340f21b8-295a-4eb3-abc5-e0e6b53459fc","resolution":{"observed_at":"2026-08-06T19:50:21.432622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-06T19:50:21.587329Z","title":"Rombach, R., Blattmann, A., Lorenz, D., Esser, P., and Ommer, B","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05300","last_updated":"2025-07-07T01:18:40Z","snapshot_observed_at":"2026-08-10T08:50:00.509260Z","submitted_at":"2025-07-07T01:18:40Z","title":"Structured Captions Improve Prompt Adherence in Text-to-Image Models (Re-LAION-Caption 19M)","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:21.587329Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2507.05300"},"observation_digest":"sha256:a20b4c95e0fc7e74f502b0bb2d928aa83e5512f8c76a33dc38cf1b053eae7b7c","observation_id":"3b8c973b-ba5c-4166-9c49-159b4e9bd0fa","resolution":{"observed_at":"2026-08-06T19:50:21.587329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10752","last_updated":"2022-04-13T11:38:44Z","snapshot_observed_at":"2026-07-06T12:20:47.369918Z","submitted_at":"2021-12-20T18:55:25Z","title":"High-Resolution Image Synthesis with Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10752","snapshot_observed_at":"2026-08-06T19:50:21.722260Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05300","last_updated":"2025-07-07T01:18:40Z","snapshot_observed_at":"2026-08-10T08:50:00.509260Z","submitted_at":"2025-07-07T01:18:40Z","title":"Structured Captions Improve Prompt Adherence in Text-to-Image Models (Re-LAION-Caption 19M)","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:21.722260Z"},"links":{"cited_paper":"/paper/2112.10752","citing_paper":"/paper/2507.05300"},"observation_digest":"sha256:ee3d1bf38526979aed0df76306f52ee722f451d0f43864515937159900e24f7d","observation_id":"684798eb-30d9-4e21-aa95-74aebaaf8576","resolution":{"observed_at":"2026-08-06T19:50:21.722260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.08402","last_updated":"2022-10-16T00:08:18Z","snapshot_observed_at":"2026-07-29T21:51:47.064287Z","submitted_at":"2022-10-16T00:08:18Z","title":"LAION-5B: An open large-scale dataset for training next generation image-text models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.08402","snapshot_observed_at":"2026-08-06T19:50:21.801084Z","title":"Webster, R., Rabin, J., Simon, L., and Jurie, F","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05300","last_updated":"2025-07-07T01:18:40Z","snapshot_observed_at":"2026-08-10T08:50:00.509260Z","submitted_at":"2025-07-07T01:18:40Z","title":"Structured Captions Improve Prompt Adherence in Text-to-Image Models (Re-LAION-Caption 19M)","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:21.801084Z"},"links":{"cited_paper":"/paper/2210.08402","citing_paper":"/paper/2507.05300"},"observation_digest":"sha256:18d5cb627e5849aac27863ac08b8410455711ecee68a05f105fce136a52d8af2","observation_id":"3f51bf79-9eea-43ce-8bfd-cd8cdc3a2d0a","resolution":{"observed_at":"2026-08-06T19:50:21.801084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.12733","last_updated":"2023-03-17T17:39:06Z","snapshot_observed_at":"2026-08-10T16:53:48.258211Z","submitted_at":"2023-03-17T17:39:06Z","title":"On the De-duplication of LAION-2B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.12733","snapshot_observed_at":"2026-08-06T19:50:21.910265Z","title":"org/abs/2303.12733","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05300","last_updated":"2025-07-07T01:18:40Z","snapshot_observed_at":"2026-08-10T08:50:00.509260Z","submitted_at":"2025-07-07T01:18:40Z","title":"Structured Captions Improve Prompt Adherence in Text-to-Image Models (Re-LAION-Caption 19M)","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:21.910265Z"},"links":{"cited_paper":"/paper/2303.12733","citing_paper":"/paper/2507.05300"},"observation_digest":"sha256:643ff5ebefd3d96509413d3576e70fecdd5aa418d0037de88e6d681bbbf75b2b","observation_id":"af231c98-e5aa-41da-ad64-83e123ae1795","resolution":{"observed_at":"2026-08-06T19:50:21.910265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.08947","last_updated":"2019-12-03T13:33:45Z","snapshot_observed_at":"2026-07-06T08:38:30.571080Z","submitted_at":"2019-11-20T14:56:47Z","title":"Real-time Scene Text Detection with Differentiable Binarization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.08947","snapshot_observed_at":"2026-08-06T19:50:21.181128Z","title":"Liu, H., Li, C., Li, Y ., and Lee, Y","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2507.05300","last_updated":"2025-07-07T01:18:40Z","snapshot_observed_at":"2026-08-10T08:50:00.509260Z","submitted_at":"2025-07-07T01:18:40Z","title":"Structured Captions Improve Prompt Adherence in Text-to-Image Models (Re-LAION-Caption 19M)","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:21.181128Z"},"links":{"cited_paper":"/paper/1911.08947","citing_paper":"/paper/2507.05300"},"observation_digest":"sha256:49d737749c8d2effcc96c802dc793af8a2659661bd51992917c9ea8d7491c2f4","observation_id":"fc42e81c-c4a3-41ff-8b16-3565f1968b45","resolution":{"observed_at":"2026-08-06T19:50:21.181128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-06T19:50:20.584536Z","title":"org/abs/2106.09685","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05300","last_updated":"2025-07-07T01:18:40Z","snapshot_observed_at":"2026-08-10T08:50:00.509260Z","submitted_at":"2025-07-07T01:18:40Z","title":"Structured Captions Improve Prompt Adherence in Text-to-Image Models (Re-LAION-Caption 19M)","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:20.584536Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2507.05300"},"observation_digest":"sha256:171b966cd0edee24620fcc88b2c12295fbb85968e88c5f4818181a14749955d6","observation_id":"b6a03b2e-96aa-4486-9572-0259eed5175a","resolution":{"observed_at":"2026-08-06T19:50:20.584536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.11416","last_updated":"2022-12-06T21:39:48Z","snapshot_observed_at":"2026-07-06T14:08:18.855958Z","submitted_at":"2022-10-20T16:58:32Z","title":"Scaling Instruction-Finetuned Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.11416","snapshot_observed_at":"2026-08-06T19:50:20.256972Z","title":"Dai, W., Li, J., Li, D., Tiong, A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05300","last_updated":"2025-07-07T01:18:40Z","snapshot_observed_at":"2026-08-10T08:50:00.509260Z","submitted_at":"2025-07-07T01:18:40Z","title":"Structured Captions Improve Prompt Adherence in Text-to-Image Models (Re-LAION-Caption 19M)","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:20.256972Z"},"links":{"cited_paper":"/paper/2210.11416","citing_paper":"/paper/2507.05300"},"observation_digest":"sha256:79a9a2390bf4c39acb330dbd1cb99a348cb56bced4dd5605b91f58a4e685eb26","observation_id":"3a50c2c2-4980-4c10-90f7-7c0efca2df78","resolution":{"observed_at":"2026-08-06T19:50:20.256972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-08-06T19:50:20.352206Z","title":"Fan, L., Krishnan, D., Isola, P., Katabi, D., and Tian, Y","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05300","last_updated":"2025-07-07T01:18:40Z","snapshot_observed_at":"2026-08-10T08:50:00.509260Z","submitted_at":"2025-07-07T01:18:40Z","title":"Structured Captions Improve Prompt Adherence in Text-to-Image Models (Re-LAION-Caption 19M)","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:20.352206Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2507.05300"},"observation_digest":"sha256:488f26d091acb9da53fb13b28a2a8628ec9b55ff5803e0d3d15398734b6106f7","observation_id":"09560a62-a540-4de7-8c60-a833ec3d9a4d","resolution":{"observed_at":"2026-08-06T19:50:20.352206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","snapshot_observed_at":"2026-07-06T17:41:10.677334Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04692","snapshot_observed_at":"2026-08-06T19:50:20.126209Z","title":"Chung, H","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05300","last_updated":"2025-07-07T01:18:40Z","snapshot_observed_at":"2026-08-10T08:50:00.509260Z","submitted_at":"2025-07-07T01:18:40Z","title":"Structured Captions Improve Prompt Adherence in Text-to-Image Models (Re-LAION-Caption 19M)","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:20.126209Z"},"links":{"cited_paper":"/paper/2403.04692","citing_paper":"/paper/2507.05300"},"observation_digest":"sha256:d86e38d9bf3998981251e5e10f40d6d43ec0db72e9abc8832ff2fe6af0d1dddb","observation_id":"7a5cdab3-5c44-4c2d-857f-bdbbecbb83dc","resolution":{"observed_at":"2026-08-06T19:50:20.126209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00115","last_updated":"2025-01-04T06:16:56Z","snapshot_observed_at":"2026-08-10T09:33:42.290137Z","submitted_at":"2024-11-28T07:01:06Z","title":"OpenHumanVid: A Large-Scale High-Quality Dataset for Enhancing Human-Centric Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00115","snapshot_observed_at":"2026-08-06T19:50:20.935002Z","title":"org/abs/2412.00115","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05300","last_updated":"2025-07-07T01:18:40Z","snapshot_observed_at":"2026-08-10T08:50:00.509260Z","submitted_at":"2025-07-07T01:18:40Z","title":"Structured Captions Improve Prompt Adherence in Text-to-Image Models (Re-LAION-Caption 19M)","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:20.935002Z"},"links":{"cited_paper":"/paper/2412.00115","citing_paper":"/paper/2507.05300"},"observation_digest":"sha256:3141c54983229fe7786b94bc6f2c92a703ef589f6483d9535ceaff8fe09f9b80","observation_id":"b5091e9e-6cf9-443f-b523-f03b45dbf721","resolution":{"observed_at":"2026-08-06T19:50:20.935002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.05300","last_updated":"2025-07-07T01:18:40Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T08:50:00.509260Z","submitted_at":"2025-07-07T01:18:40Z","title":"Structured Captions Improve Prompt Adherence in Text-to-Image Models (Re-LAION-Caption 19M)"},"reference_resolution":{"displayed":16,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":16},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 16 of 16 outbound references and 1 inbound Pith citation observation for arXiv:2507.05300."}