{"as_of":"2026-08-18T01:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:30b8daeca2c98dcd6b72077c9211027ff12f1e1cf98b24eb9d6c506d0d0a7ab3","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":75,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":75,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":75,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":75,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T10:27:13.254590Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":867,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-16T17:25:16.004651Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2201.12086","doi":"10.48550/arxiv.2201.12086","metadata_source":"pith","pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Blip: Bootstrapping language- image pre-training for uniﬁed vision-language understanding and generation","venue":"cs.CV","work_id":"ed5a5938-1f3b-44a9-9543-ebafa9af4d53","year":2022},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-08-17T03:00:38.806206Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:59e80e7de2c7af5d943a19e5dc8964d39273de1b799f59d73540574091368e1d","observation_id":"baa19c17-51eb-4465-be33-c1137286e3f4","resolution":{"observed_at":"2026-05-12T04:22:30.106705Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-16T17:25:16.004651Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2201.12086","doi":"10.48550/arxiv.2201.12086","metadata_source":"pith","pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Blip: Bootstrapping language- image pre-training for uniﬁed vision-language understanding and generation","venue":"cs.CV","work_id":"ed5a5938-1f3b-44a9-9543-ebafa9af4d53","year":2022},"citing_paper":{"arxiv_id":"2205.01917","last_updated":"2022-06-14T00:48:04Z","snapshot_observed_at":"2026-08-13T15:12:42.567441Z","submitted_at":"2022-05-04T07:01:14Z","title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-15T10:53:08.292063Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2205.01917"},"observation_digest":"sha256:970ae4857812ddf38512fe1e9ad5d757d260b78b509086ad4c1de7b4b2a5fed8","observation_id":"bae1fd20-baed-4f46-b920-47083fb98875","resolution":{"observed_at":"2026-05-15T10:53:08.440780Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-16T17:25:16.004651Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2201.12086","doi":"10.48550/arxiv.2201.12086","metadata_source":"pith","pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Blip: Bootstrapping language- image pre-training for uniﬁed vision-language understanding and generation","venue":"cs.CV","work_id":"ed5a5938-1f3b-44a9-9543-ebafa9af4d53","year":2022},"citing_paper":{"arxiv_id":"2210.08402","last_updated":"2022-10-16T00:08:18Z","snapshot_observed_at":"2026-08-13T17:36:16.794649Z","submitted_at":"2022-10-16T00:08:18Z","title":"LAION-5B: An open large-scale dataset for training next generation image-text models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-13T14:22:16.968028Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2210.08402"},"observation_digest":"sha256:c14ee92086ef72181241017a28469bbff8ec7b06ca563f837212e52ff0a4d416","observation_id":"593de29b-f42b-43f9-a565-bfa484b3952f","resolution":{"observed_at":"2026-05-13T14:22:17.291001Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-16T17:25:16.004651Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-12T20:41:19.191871Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.09449","last_updated":"2024-11-14T13:52:43Z","snapshot_observed_at":"2026-08-15T10:04:04.093945Z","submitted_at":"2024-11-14T13:52:43Z","title":"Image Regeneration: Evaluating Text-to-Image Model via Generating Identical Image with Multimodal Large Language Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-12T20:41:19.191871Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2411.09449"},"observation_digest":"sha256:258efd7dda2e418bfdbc3a82b7abf5a78cbd4f9a4c514abae19a365f90fd7ef8","observation_id":"9770d1f3-3e38-4f90-88bf-3591b6badb29","resolution":{"observed_at":"2026-08-12T20:41:19.191871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-16T17:25:16.004651Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-12T15:06:04.956799Z","title":"Blip: Bootstrapping language-image pre-training for uni- fied vision-language understanding and generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-17T17:45:10.509903Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:04.956799Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:0b40eea04d218930c6127903661edad760f9b51b354621767de79ca91a98c738","observation_id":"2073b075-6195-4090-a649-687ad2ea368c","resolution":{"observed_at":"2026-08-12T15:06:04.956799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-16T17:25:16.004651Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-12T14:52:57.048692Z","title":"Blip: Bootstrapping language-image pre- training for unified vision-language understanding and generation, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14832","last_updated":"2024-11-22T10:10:53Z","snapshot_observed_at":"2026-08-16T12:34:15.820992Z","submitted_at":"2024-11-22T10:10:53Z","title":"VisGraphVar: A Benchmark Generator for Assessing Variability in Graph Analysis Using Large Vision-Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T14:52:57.048692Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2411.14832"},"observation_digest":"sha256:9802eab5b9d5507d629428d335697f699976627f9d7e91480a76a346ba28d571","observation_id":"7f4ebab1-12e7-43f1-b7ab-17947b7f31d3","resolution":{"observed_at":"2026-08-12T14:52:57.048692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-16T17:25:16.004651Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-12T14:30:51.286288Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15128","last_updated":"2024-11-26T18:01:08Z","snapshot_observed_at":"2026-08-17T09:41:33.833256Z","submitted_at":"2024-11-22T18:51:51Z","title":"Health AI Developer Foundations","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-12T14:30:51.286288Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2411.15128"},"observation_digest":"sha256:c7295de49bc97da9191bed1173a979bd9a6dba611f21e84e55d31ee9f36b7a57","observation_id":"89d19cbc-5e0b-4037-964f-f36f9e522909","resolution":{"observed_at":"2026-08-12T14:30:51.286288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-16T17:25:16.004651Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-12T12:02:31.527661Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.17558","last_updated":"2024-11-26T16:21:03Z","snapshot_observed_at":"2026-08-17T18:12:52.026818Z","submitted_at":"2024-11-26T16:21:03Z","title":"Natural Language Understanding and Inference with MLLM in Visual Question Answering: A Survey","version":1},"reference_index":241,"source":"pdf_text","source_observed_at":"2026-08-12T12:02:31.527661Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2411.17558"},"observation_digest":"sha256:331793d28054c9351ca967b1c12791a548c323c852a3cfbde9cfea55ab24cbec","observation_id":"2e47c0ab-8447-4cf5-bb4f-4af55df8b0d1","resolution":{"observed_at":"2026-08-12T12:02:31.527661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-16T17:25:16.004651Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-12T10:24:06.674598Z","title":"Blip: Bootstrapping language-image pre-training for uni- fied vision-language understanding and generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.674598Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:db41b7a42d206f3dfd03a082040d208ddb002cec648297b673625a9ea1e4f298","observation_id":"eed1a4c1-c4c0-487e-837b-c911053a739d","resolution":{"observed_at":"2026-08-12T10:24:06.674598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-16T17:25:16.004651Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-11T23:16:56.050467Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.02641","last_updated":"2024-12-03T18:13:37Z","snapshot_observed_at":"2026-08-17T11:22:55.802524Z","submitted_at":"2024-12-03T18:13:37Z","title":"SEMANTIC SEE-THROUGH GOGGLES: Wearing Linguistic Virtual Reality in (Artificial) Intelligence","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T23:16:56.050467Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2412.02641"},"observation_digest":"sha256:cb865f1a04c9b021b82baafd3c585fb2756cdf72d63ebee2709bbfaa17bcd5ce","observation_id":"6847871d-1bde-49d8-a8ea-f8c81cab8a2c","resolution":{"observed_at":"2026-08-11T23:16:56.050467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-16T17:25:16.004651Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-11T05:51:35.234441Z","title":"Available: https://arxiv.org/abs/2201.12086","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17077","last_updated":"2024-12-22T15:59:07Z","snapshot_observed_at":"2026-08-17T15:32:35.046640Z","submitted_at":"2024-12-22T15:59:07Z","title":"SubstationAI: Multimodal Large Model-Based Approaches for Analyzing Substation Equipment Faults","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-11T05:51:35.234441Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2412.17077"},"observation_digest":"sha256:a391d1b64a48f47882579cdad0a4e1d945d79da60954c5e6c58a96b1cf30246c","observation_id":"99ed33be-fbd4-4c10-9f53-f5d89379b7c7","resolution":{"observed_at":"2026-08-11T05:51:35.234441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-16T17:25:16.004651Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-11T04:57:31.954129Z","title":", author Li, D","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.18641","last_updated":"2025-03-23T02:30:12Z","snapshot_observed_at":"2026-08-16T11:40:27.687838Z","submitted_at":"2024-12-24T07:13:17Z","title":"ZenSVI: An Open-Source Software for the Integrated Acquisition, Processing and Analysis of Street View Imagery Towards Scalable Urban Science","version":3},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-11T04:57:31.954129Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2412.18641"},"observation_digest":"sha256:1866386d75e833eeb351be06e44118566cfe75298ab5bad373f620f6bed73bea","observation_id":"de06b389-afbe-44f8-826d-961e3a0560b2","resolution":{"observed_at":"2026-08-11T04:57:31.954129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-16T17:25:16.004651Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-10T23:51:00.774678Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.19954","last_updated":"2024-12-27T23:25:51Z","snapshot_observed_at":"2026-08-17T17:11:25.932086Z","submitted_at":"2024-12-27T23:25:51Z","title":"ErgoChat: a Visual Query System for the Ergonomic Risk Assessment of Construction Workers","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T23:51:00.774678Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2412.19954"},"observation_digest":"sha256:37e4c2596180c29172f4659047e65ecfc8d3aba3ef168dc6b05e76cb898e0bbc","observation_id":"c198fae9-30b2-4257-ae32-808f2c83ef65","resolution":{"observed_at":"2026-08-10T23:51:00.774678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-16T17:25:16.004651Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-10T22:08:54.312338Z","title":"Available: https://arxiv.org/abs/2201.12086","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.02706","last_updated":"2025-01-06T01:18:11Z","snapshot_observed_at":"2026-08-15T17:15:01.711479Z","submitted_at":"2025-01-06T01:18:11Z","title":"Multilevel Semantic-Aware Model for AI-Generated Video Quality Assessment","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:54.312338Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2501.02706"},"observation_digest":"sha256:8a93026ad89c47e8958c3278714e25806e43bb7b26d199c961c6129821c4dd8e","observation_id":"4bfdaa4b-4bbd-4caf-9e20-00cb41d9d5b8","resolution":{"observed_at":"2026-08-10T22:08:54.312338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-16T17:25:16.004651Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-10T21:42:12.508338Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-17T18:00:27.329541Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:12.508338Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2501.04322"},"observation_digest":"sha256:81fe2aea37051bf4f322e372ad225e56d020faca88093266b28a4587939051f7","observation_id":"bd1231c0-5bab-4062-a9a6-4704c070bda8","resolution":{"observed_at":"2026-08-10T21:42:12.508338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-16T17:25:16.004651Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-10T20:39:43.917693Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.07802","last_updated":"2025-01-14T03:03:37Z","snapshot_observed_at":"2026-08-15T22:04:01.652125Z","submitted_at":"2025-01-14T03:03:37Z","title":"Visual Language Models as Operator Agents in the Space Domain","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T20:39:43.917693Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2501.07802"},"observation_digest":"sha256:562c1315891be86d9ca982bd302bd5947927fc9dedf6ee76c85077dffafca93e","observation_id":"f4039f18-cc6a-4a87-b7a3-d2b57cfa79a7","resolution":{"observed_at":"2026-08-10T20:39:43.917693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-16T17:25:16.004651Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-10T20:34:12.159521Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.07972","last_updated":"2025-01-14T09:45:10Z","snapshot_observed_at":"2026-08-14T20:58:53.347818Z","submitted_at":"2025-01-14T09:45:10Z","title":"Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-10T20:34:12.159521Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2501.07972"},"observation_digest":"sha256:688c3730529ea63d5ae2d38a5d3d756e5089db9398ef6cb0e92b95561143110c","observation_id":"5a6e88d5-6b6b-4b5e-8c8d-597058c38908","resolution":{"observed_at":"2026-08-10T20:34:12.159521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-16T17:25:16.004651Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-10T20:15:21.494606Z","title":"Available: https://arxiv.org/abs/2201.12086","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.09014","last_updated":"2025-08-05T19:37:35Z","snapshot_observed_at":"2026-08-15T16:17:28.410677Z","submitted_at":"2025-01-15T18:57:17Z","title":"How Do Generative Models Draw a Software Engineer? A Case Study on Stable Diffusion Bias","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:21.494606Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2501.09014"},"observation_digest":"sha256:9be9867639cb19c7978eb71e72e350977d0b3e48a0e410d3b5f0e18fd67ea260","observation_id":"d1958c10-42ea-438b-8eb3-9c9d01be1d5a","resolution":{"observed_at":"2026-08-10T20:15:21.494606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-16T17:25:16.004651Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-10T19:44:31.705445Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.09815","last_updated":"2025-01-16T20:02:13Z","snapshot_observed_at":"2026-08-17T16:16:03.767205Z","submitted_at":"2025-01-16T20:02:13Z","title":"Lossy Compression with Pretrained Diffusion Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-10T19:44:31.705445Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2501.09815"},"observation_digest":"sha256:acb911568f0a663ead5984095f5c0db262f1e8abdf56c50dc20684217bfdbbe9","observation_id":"0c9aec8b-a7cc-442d-bb24-7753da6d495a","resolution":{"observed_at":"2026-08-10T19:44:31.705445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-16T17:25:16.004651Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-10T15:24:49.345180Z","title":"BLIP:Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.14101","last_updated":"2025-01-23T21:20:10Z","snapshot_observed_at":"2026-08-16T21:15:37.017458Z","submitted_at":"2025-01-23T21:20:10Z","title":"StreamingRAG: Real-time Contextual Retrieval and Generation Framework","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T15:24:49.345180Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2501.14101"},"observation_digest":"sha256:eda86d266c49ff187ef096830f05ef8a4d7cc97091f1dfea26875b1c8cb82e93","observation_id":"3f54cef2-46f8-4468-b683-f828dd1ac61d","resolution":{"observed_at":"2026-08-10T15:24:49.345180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-16T17:25:16.004651Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-10T13:36:47.024939Z","title":"Blip: Bootstrapping language-imagepre-training forunifiedvision-languageunderstandingandgeneration,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.16300","last_updated":"2025-01-27T18:38:36Z","snapshot_observed_at":"2026-08-17T01:07:23.946389Z","submitted_at":"2025-01-27T18:38:36Z","title":"Large Models in Dialogue for Active Perception and Anomaly Detection","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T13:36:47.024939Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2501.16300"},"observation_digest":"sha256:ada0f94c060455cc73d832b5ca87b676092456baca2fc5b403ba9a43c59fb7ac","observation_id":"887e33d7-f74e-4daa-94d3-23655e2efce0","resolution":{"observed_at":"2026-08-10T13:36:47.024939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-16T17:25:16.004651Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-10T00:58:34.749290Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.18033","last_updated":"2025-01-29T22:42:05Z","snapshot_observed_at":"2026-08-17T13:43:57.758497Z","submitted_at":"2025-01-29T22:42:05Z","title":"Generative AI for Vision: A Comprehensive Study of Frameworks and Applications","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T00:58:34.749290Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2501.18033"},"observation_digest":"sha256:4a4643d7d3eacd5bbdd0bba1ec3b248a4eaf030760d0bcb33f7bb58f52bdae77","observation_id":"f10a70b6-0a7e-48e1-a9ce-3aae5d7e0072","resolution":{"observed_at":"2026-08-10T00:58:34.749290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-16T17:25:16.004651Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-09T22:09:40.627623Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.18880","last_updated":"2025-01-31T04:30:42Z","snapshot_observed_at":"2026-08-14T20:57:02.898625Z","submitted_at":"2025-01-31T04:30:42Z","title":"RLS3: RL-Based Synthetic Sample Selection to Enhance Spatial Reasoning in Vision-Language Models for Indoor Autonomous Perception","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-09T22:09:40.627623Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2501.18880"},"observation_digest":"sha256:d27a522c48e0cedb4d35385796ca618b08edd43c88e735ce23e0b707df212f12","observation_id":"eca4d9dd-b8b6-4138-96d8-23b80e962e9d","resolution":{"observed_at":"2026-08-09T22:09:40.627623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-16T17:25:16.004651Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-08T12:58:24.178937Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.07391","last_updated":"2025-02-11T09:19:46Z","snapshot_observed_at":"2026-08-16T00:28:49.223218Z","submitted_at":"2025-02-11T09:19:46Z","title":"Target-Augmented Shared Fusion-based Multimodal Sarcasm Explanation Generation","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-08T12:58:24.178937Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2502.07391"},"observation_digest":"sha256:99709383310bfabe36a8766c1fafc009a8069855760b5267871a185daa54c521","observation_id":"3706df61-7962-400b-b628-d8fafbf11f26","resolution":{"observed_at":"2026-08-08T12:58:24.178937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-16T17:25:16.004651Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-08T13:35:05.092936Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.07838","last_updated":"2025-02-13T11:13:14Z","snapshot_observed_at":"2026-08-14T14:41:02.358184Z","submitted_at":"2025-02-11T02:31:45Z","title":"NanoVLMs: How small can we go and still make coherent Vision Language Models?","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-08T13:35:05.092936Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2502.07838"},"observation_digest":"sha256:774c6df7f3f65484dc961c242096c1b219d42b853cf67df9357dd2fc7aec9945","observation_id":"cac67ee3-c85f-4987-94ab-a04fdde58d7d","resolution":{"observed_at":"2026-08-08T13:35:05.092936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-16T17:25:16.004651Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-07T20:38:22.848810Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.09757","last_updated":"2025-02-13T20:31:28Z","snapshot_observed_at":"2026-08-17T18:30:39.404326Z","submitted_at":"2025-02-13T20:31:28Z","title":"The AI-Therapist Duo: Exploring the Potential of Human-AI Collaboration in Personalized Art Therapy for PICS Intervention","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T20:38:22.848810Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2502.09757"},"observation_digest":"sha256:6d6a14be4c972d60063c9cc790cdbd2f4b4ef980264f4778a2443eac781085f7","observation_id":"54af3713-1362-41c9-b479-7caf95bea41e","resolution":{"observed_at":"2026-08-07T20:38:22.848810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-16T17:25:16.004651Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-07T19:25:33.743835Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.10118","last_updated":"2025-09-04T15:00:25Z","snapshot_observed_at":"2026-08-12T16:25:44.853270Z","submitted_at":"2025-02-14T12:33:19Z","title":"Image Embedding Sampling Method for Diverse Captioning","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T19:25:33.743835Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2502.10118"},"observation_digest":"sha256:f71ae7d2810cc88ac617c09c19f2bd52c1326e4492421f57ff1631e08c632519","observation_id":"75f5a4ab-e5bf-4ba6-bc12-dcd437da3911","resolution":{"observed_at":"2026-08-07T19:25:33.743835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-16T17:25:16.004651Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-16T10:27:13.254590Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.18204","last_updated":"2025-04-25T09:35:02Z","snapshot_observed_at":"2026-08-16T10:19:42.530344Z","submitted_at":"2025-04-25T09:35:02Z","title":"Optimizing Multi-Round Enhanced Training in Diffusion Models for Improved Preference Understanding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T10:27:13.254590Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2504.18204"},"observation_digest":"sha256:82fe426ccdd275f4f76fef5260dc56858f4c6fbef2a7e4180aa17d166526a8d5","observation_id":"e08b8430-0906-43d4-b9e3-e5f9ed5b5033","resolution":{"observed_at":"2026-08-16T10:27:13.254590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-16T17:25:16.004651Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-16T05:13:23.796291Z","title":"BLIP: Bootstrap- ping Language-Image Pre-training for Unified Vision- Language Understanding and Generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.21226","last_updated":"2025-07-26T23:28:24Z","snapshot_observed_at":"2026-08-16T05:07:23.712237Z","submitted_at":"2025-04-29T23:41:06Z","title":"MemeBLIP2: A novel lightweight multimodal system to detect harmful memes","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T05:13:23.796291Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2504.21226"},"observation_digest":"sha256:289940509feaa1e73e8b1b5ac2eccfd873680e3feba18d65ada9a58d5d7c9b2f","observation_id":"42146ad3-b134-4b69-961b-dbbfd3f5cb50","resolution":{"observed_at":"2026-08-16T05:13:23.796291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-16T17:25:16.004651Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-16T04:43:11.313155Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.00759","last_updated":"2025-05-12T20:46:35Z","snapshot_observed_at":"2026-08-16T09:38:06.751547Z","submitted_at":"2025-05-01T17:47:55Z","title":"Multi-Modal Language Models as Text-to-Image Model Evaluators","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:11.313155Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2505.00759"},"observation_digest":"sha256:176a5d76748e226b204b5ceefa5190323e8bfe097bb79efad6ac6efb5069fe63","observation_id":"794f09dd-4141-4355-b892-a926bea30d99","resolution":{"observed_at":"2026-08-16T04:43:11.313155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-16T17:25:16.004651Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-16T04:12:39.307006Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.01851","last_updated":"2025-05-03T16:09:52Z","snapshot_observed_at":"2026-08-16T04:06:30.341011Z","submitted_at":"2025-05-03T16:09:52Z","title":"Mitigating Group-Level Fairness Disparities in Federated Visual Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T04:12:39.307006Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2505.01851"},"observation_digest":"sha256:1d185907fa81c04b18752ac99ff2c0756a3d0fcad55a94bb97ee3da23f16bca0","observation_id":"a3320923-bfec-449d-a15b-78ba96ab9fad","resolution":{"observed_at":"2026-08-16T04:12:39.307006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-16T17:25:16.004651Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-15T23:56:39.551167Z","title":"R., Gotmare, A., Joty, S., Xiong, C., Hoi, S","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.03350","last_updated":"2025-05-06T09:19:12Z","snapshot_observed_at":"2026-08-15T23:51:13.719691Z","submitted_at":"2025-05-06T09:19:12Z","title":"A Vision-Language Model for Focal Liver Lesion Classification","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T23:56:39.551167Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2505.03350"},"observation_digest":"sha256:ec5702a9b9230487fa0e3f3fc6129659e54fb1bd06c31285b210d03582232373","observation_id":"8d4e718e-278e-472a-948d-73f87d1af907","resolution":{"observed_at":"2026-08-15T23:56:39.551167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-16T17:25:16.004651Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-15T22:37:17.533992Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.08803","last_updated":"2025-05-10T22:42:29Z","snapshot_observed_at":"2026-08-17T04:03:29.503396Z","submitted_at":"2025-05-10T22:42:29Z","title":"Multi-modal Synthetic Data Training and Model Collapse: Insights from VLMs and Diffusion Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T22:37:17.533992Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2505.08803"},"observation_digest":"sha256:ae7c4752706caec63d74d8f89a3383723b805f1bb16a41d2f3cd4e97740f4139","observation_id":"2ec65496-e636-4164-a889-d5a25d926e84","resolution":{"observed_at":"2026-08-15T22:37:17.533992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-16T17:25:16.004651Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-15T20:14:56.317997Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.13669","last_updated":"2025-05-19T19:17:06Z","snapshot_observed_at":"2026-08-15T20:09:39.140637Z","submitted_at":"2025-05-19T19:17:06Z","title":"GeoVLM: Improving Automated Vehicle Geolocalisation Using Vision-Language Matching","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T20:14:56.317997Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2505.13669"},"observation_digest":"sha256:c88d2878c1b35a2e75f9b2437797dfbeb61b95d402165407f26b230e8586ec67","observation_id":"f1a492cd-2259-4e83-9e96-aa9c3b0ec6b9","resolution":{"observed_at":"2026-08-15T20:14:56.317997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-16T17:25:16.004651Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-07T15:42:39.298701Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14197","last_updated":"2025-05-20T10:55:26Z","snapshot_observed_at":"2026-08-13T08:14:54.005493Z","submitted_at":"2025-05-20T10:55:26Z","title":"Towards Omnidirectional Reasoning with 360-R1: A Dataset, Benchmark, and GRPO-based Method","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:39.298701Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2505.14197"},"observation_digest":"sha256:3a54cae5119cd25adc211d530da404378724540e0b096abf651a32bffd4d3ff5","observation_id":"b12929d5-5262-434c-84bd-2cdb3d5281e5","resolution":{"observed_at":"2026-08-07T15:42:39.298701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-16T17:25:16.004651Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-07T14:58:27.296305Z","title":"Blip: Bootstrapped language-image pre- training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16805","last_updated":"2025-05-22T15:44:30Z","snapshot_observed_at":"2026-08-14T20:58:52.169532Z","submitted_at":"2025-05-22T15:44:30Z","title":"SOLVE: Synergy of Language-Vision and End-to-End Networks for Autonomous Driving","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:27.296305Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2505.16805"},"observation_digest":"sha256:e9dd4328a9d6d722c4b57e307ae6375eb3608c4cb84ba2e74eb42dcb5131dacb","observation_id":"67f12da4-7886-4733-93d2-73a475b83fd1","resolution":{"observed_at":"2026-08-07T14:58:27.296305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-16T17:25:16.004651Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-07T14:23:56.621484Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19242","last_updated":"2025-05-25T17:42:53Z","snapshot_observed_at":"2026-08-15T13:28:26.176047Z","submitted_at":"2025-05-25T17:42:53Z","title":"Deformable Attentive Visual Enhancement for Referring Segmentation Using Vision-Language Model","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:56.621484Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2505.19242"},"observation_digest":"sha256:f1aed8551ddf5c6bd0b8dbd5da01f0d31e5eeecda2beaac11fd7f42a09906ce5","observation_id":"16464c40-9da1-4e3c-a1af-1ab136a3a7b7","resolution":{"observed_at":"2026-08-07T14:23:56.621484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-16T17:25:16.004651Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-07T13:08:04.386112Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22613","last_updated":"2025-05-28T17:29:34Z","snapshot_observed_at":"2026-08-13T00:07:33.143025Z","submitted_at":"2025-05-28T17:29:34Z","title":"RICO: Improving Accuracy and Completeness in Image Recaptioning via Visual Reconstruction","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T13:08:04.386112Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2505.22613"},"observation_digest":"sha256:63c800cec478883fe921fe94963a9935eda18cf85dc649d8914d93edf8e55a61","observation_id":"a14b41b1-eede-4c43-b21c-bf8d2717c0e5","resolution":{"observed_at":"2026-08-07T13:08:04.386112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-16T17:25:16.004651Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-07T10:45:30.908336Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.04545","last_updated":"2025-06-05T01:30:40Z","snapshot_observed_at":"2026-08-10T09:51:16.910868Z","submitted_at":"2025-06-05T01:30:40Z","title":"Seamless and Efficient Interactions within a Mixed-Dimensional Information Space","version":1},"reference_index":183,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:30.908336Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2506.04545"},"observation_digest":"sha256:06a09e22f17de1a45318b7c41a4be4bb3a622a4c764cb53591ddbb8f07313df4","observation_id":"99c99c4c-5268-495e-8743-391df5f82fe2","resolution":{"observed_at":"2026-08-07T10:45:30.908336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-16T17:25:16.004651Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-07T05:11:19.932135Z","title":"Blip: Bootstrapping language-image pre-training for uni- fied vision-language understanding and generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08553","last_updated":"2025-06-10T08:21:38Z","snapshot_observed_at":"2026-08-15T04:48:41.491398Z","submitted_at":"2025-06-10T08:21:38Z","title":"From Pixels to Graphs: using Scene and Knowledge Graphs for HD-EPIC VQA Challenge","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:19.932135Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2506.08553"},"observation_digest":"sha256:7b579d7124a4bdb305aaaf098bcd8c8bbb0008307d21c89b9487c818a14d37af","observation_id":"e3bc46e9-c2d9-4ca7-a005-b8171900903c","resolution":{"observed_at":"2026-08-07T05:11:19.932135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-16T17:25:16.004651Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-07T04:42:22.467423Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-17T20:47:45.784136Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:22.467423Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2506.10100"},"observation_digest":"sha256:4280cce1779eae305dc224d14ff07938d747a6dcd6458d162ce9ec0369beeea1","observation_id":"ea5a9fc6-5d0c-4dcb-8641-bf866810c160","resolution":{"observed_at":"2026-08-07T04:42:22.467423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-16T17:25:16.004651Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-07T04:33:14.835920Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.10282","last_updated":"2025-06-12T01:44:46Z","snapshot_observed_at":"2026-08-15T23:34:02.450335Z","submitted_at":"2025-06-12T01:44:46Z","title":"Graph-MLLM: Harnessing Multimodal Large Language Models for Multimodal Graph Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:14.835920Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2506.10282"},"observation_digest":"sha256:a85c439f08f0e3bb2ff650534fc635f5463d72a933f197397ca6cb089924bcb5","observation_id":"42c0f4e7-0bd0-4110-a0fb-01d06fc962e2","resolution":{"observed_at":"2026-08-07T04:33:14.835920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-16T17:25:16.004651Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-07T05:01:06.943940Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","snapshot_observed_at":"2026-08-14T19:05:16.545014Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:06.943940Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2506.17267"},"observation_digest":"sha256:55c4b0e214c6912db47500086e68a15c664832fd3d3d5ec9627e4d04dc4bd538","observation_id":"db04e06f-f11b-45e7-a857-2b6f14e0b7e2","resolution":{"observed_at":"2026-08-07T05:01:06.943940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-16T17:25:16.004651Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-06T21:03:01.759523Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.01255","last_updated":"2025-07-02T00:20:06Z","snapshot_observed_at":"2026-08-15T02:03:45.493317Z","submitted_at":"2025-07-02T00:20:06Z","title":"AIGVE-MACS: Unified Multi-Aspect Commenting and Scoring Model for AI-Generated Video Evaluation","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T21:03:01.759523Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2507.01255"},"observation_digest":"sha256:02ced199c9793ebf3e425b3827c3d1fbb40ce576779e4dead66909f1f42d47d6","observation_id":"71e1d68b-15df-4b44-920d-feab10009b62","resolution":{"observed_at":"2026-08-06T21:03:01.759523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-16T17:25:16.004651Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-06T19:54:39.134498Z","title":"BLIP: Bootstrapped Language-Image Pre-training for Uni- fied Vision-Language Understanding and Generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.04317","last_updated":"2025-07-06T09:53:31Z","snapshot_observed_at":"2026-08-15T13:40:17.323684Z","submitted_at":"2025-07-06T09:53:31Z","title":"CLIP-RL: Surgical Scene Segmentation Using Contrastive Language-Vision Pretraining & Reinforcement Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:39.134498Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2507.04317"},"observation_digest":"sha256:40a67b6a5293cb6e322e24d25f55d8148a80e4616b7f0ed1913dbd0518a62164","observation_id":"82005ae4-b23d-42ac-82a1-731b1d9e7fdf","resolution":{"observed_at":"2026-08-06T19:54:39.134498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-16T17:25:16.004651Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-06T19:47:52.700190Z","title":"arXiv:2201.12086","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.04702","last_updated":"2025-07-07T06:51:40Z","snapshot_observed_at":"2026-08-15T18:59:04.717375Z","submitted_at":"2025-07-07T06:51:40Z","title":"Tempo-R0: A Video-MLLM for Temporal Video Grounding through Efficient Temporal Sensing Reinforcement Learning","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:52.700190Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2507.04702"},"observation_digest":"sha256:9cd64d257e05ded674bfddd14169d5beff07c430c626cace4c68af581107a081","observation_id":"8f1ccedf-c89b-40bd-a1e3-657f41d1ce3c","resolution":{"observed_at":"2026-08-06T19:47:52.700190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-16T17:25:16.004651Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-06T19:41:37.813687Z","title":"Junnan Li, Dongxu Li, Silvio Savarese, and Steven Hoi","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04976","last_updated":"2025-07-07T13:19:43Z","snapshot_observed_at":"2026-08-15T14:21:28.889629Z","submitted_at":"2025-07-07T13:19:43Z","title":"Can Video LLMs Refuse to Answer? Alignment for Answerability in Video Large Language Models","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T19:41:37.813687Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2507.04976"},"observation_digest":"sha256:d977b42db133757a3ca0a24eb86307a0538c55a84eca8dd7981bb125f43089dc","observation_id":"0087c442-8ec5-4d59-879e-a0b2f32f4ba8","resolution":{"observed_at":"2026-08-06T19:41:37.813687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-16T17:25:16.004651Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-06T17:21:35.235072Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.11155","last_updated":"2025-07-15T10:04:27Z","snapshot_observed_at":"2026-08-14T03:33:23.638520Z","submitted_at":"2025-07-15T10:04:27Z","title":"Bridging the Gap in Vision Language Models in Identifying Unsafe Concepts Across Modalities","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:35.235072Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2507.11155"},"observation_digest":"sha256:cdbc5800e0593411fc2a6065b3f8c673fa4b6ef001e7b1e8da48f2bdb676e1e4","observation_id":"438ccd36-c875-413f-a23b-e4f14297bd45","resolution":{"observed_at":"2026-08-06T17:21:35.235072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-16T17:25:16.004651Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-06T16:22:49.656219Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13708","last_updated":"2025-07-23T13:00:06Z","snapshot_observed_at":"2026-08-09T01:02:26.043071Z","submitted_at":"2025-07-18T07:33:08Z","title":"PoemTale Diffusion: Minimising Information Loss in Poem to Image Generation with Multi-Stage Prompt Refinement","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T16:22:49.656219Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2507.13708"},"observation_digest":"sha256:574c9f989e1ae94727174ace9f9b1a79b46220029f322f7b64de7be08280468f","observation_id":"b1b5bbc1-8c36-47f8-a009-6567123d5122","resolution":{"observed_at":"2026-08-06T16:22:49.656219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-16T17:25:16.004651Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-06T15:08:35.573726Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.16704","last_updated":"2025-07-22T15:38:12Z","snapshot_observed_at":"2026-08-13T07:18:31.685455Z","submitted_at":"2025-07-22T15:38:12Z","title":"Screen2AX: Vision-Based Approach for Automatic macOS Accessibility Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T15:08:35.573726Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2507.16704"},"observation_digest":"sha256:a82aae0aa2766a6af58aa10a09d86697926c2e3432b79c46f7d16806835a5d21","observation_id":"5ae2999d-18ae-4e94-a659-52a64351a8ac","resolution":{"observed_at":"2026-08-06T15:08:35.573726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-16T17:25:16.004651Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-06T14:43:19.468148Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.18004","last_updated":"2025-07-31T22:39:25Z","snapshot_observed_at":"2026-08-16T14:03:09.681125Z","submitted_at":"2025-07-24T00:39:19Z","title":"E.A.R.T.H.: Structuring Creative Evolution through Model Error in Generative AI","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T14:43:19.468148Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2507.18004"},"observation_digest":"sha256:664e966a0bd681c0658f34107edbbd6f61cda95addabfcfc4d79c2fea4cedefa","observation_id":"20cd51c6-8fcc-41d1-ab1d-36b60a47c7b5","resolution":{"observed_at":"2026-08-06T14:43:19.468148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-16T17:25:16.004651Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-06T16:21:59.741127Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.21120","last_updated":"2025-07-18T09:53:03Z","snapshot_observed_at":"2026-08-12T04:32:01.920930Z","submitted_at":"2025-07-18T09:53:03Z","title":"Affect-aware Cross-Domain Recommendation for Art Therapy via Music Preference Elicitation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T16:21:59.741127Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2507.21120"},"observation_digest":"sha256:511424c3ee3fabb3b11567fbe4b2164bd722d3aa6fa70f847bb430423e9401c4","observation_id":"2afceee4-e63c-4777-8634-79791c7c625c","resolution":{"observed_at":"2026-08-06T16:21:59.741127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-16T17:25:16.004651Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-06T11:54:43.153675Z","title":"”BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation” arXiv preprint arXiv:2201.12086 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.22304","last_updated":"2025-07-30T00:34:20Z","snapshot_observed_at":"2026-08-16T22:26:23.461324Z","submitted_at":"2025-07-30T00:34:20Z","title":"Invisible Injections: Exploiting Vision-Language Models Through Steganographic Prompt Embedding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T11:54:43.153675Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2507.22304"},"observation_digest":"sha256:52dbe2293b3a34df7d78f58f67fec155a1a64809c207a9738d29e46efd12e012","observation_id":"546f64ed-bc4f-46f2-b00c-a17c7af023ba","resolution":{"observed_at":"2026-08-06T11:54:43.153675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-16T17:25:16.004651Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-06T11:45:25.877668Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-17T20:52:26.160919Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.877668Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:cd0ead946d4a145a9dc4a692183050131c322d7709ff127831f3f787478d703e","observation_id":"ed8c2d38-64ab-4837-a083-f34616d960c3","resolution":{"observed_at":"2026-08-06T11:45:25.877668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-16T17:25:16.004651Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-06T11:12:41.943831Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.23010","last_updated":"2025-07-30T18:19:11Z","snapshot_observed_at":"2026-08-16T03:55:07.393547Z","submitted_at":"2025-07-30T18:19:11Z","title":"Investigating the Invertibility of Multimodal Latent Spaces: Limitations of Optimization-Based Methods","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T11:12:41.943831Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2507.23010"},"observation_digest":"sha256:c51e6f4b21599a6602b365903091aa28538e855f1833d7bb487ec21432da1b46","observation_id":"ab77093d-a728-44e0-b59a-2389c8319f8e","resolution":{"observed_at":"2026-08-06T11:12:41.943831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-16T17:25:16.004651Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-05T20:10:57.727313Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.11153","last_updated":"2025-08-15T01:49:58Z","snapshot_observed_at":"2026-08-17T20:35:27.080343Z","submitted_at":"2025-08-15T01:49:58Z","title":"LEARN: A Story-Driven Layout-to-Image Generation Framework for STEM Instruction","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T20:10:57.727313Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2508.11153"},"observation_digest":"sha256:1d3c19d5bc6b188b8604be005b3bb542df5b986ffc468e1331a55d2be8574351","observation_id":"3056d7ab-380b-44a3-b4ea-be76eebf5597","resolution":{"observed_at":"2026-08-05T20:10:57.727313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-16T17:25:16.004651Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-15T17:15:20.724340Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.13843","last_updated":"2025-08-19T14:06:13Z","snapshot_observed_at":"2026-08-17T21:02:52.779852Z","submitted_at":"2025-08-19T14:06:13Z","title":"UniECS: Unified Multimodal E-Commerce Search Framework with Gated Cross-modal Fusion","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T17:15:20.724340Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2508.13843"},"observation_digest":"sha256:3ddb198b5fa1bf2084916f783e433baf9b2fdd3fa53ec3853cb2290f64d431b3","observation_id":"fb579a1d-9280-45a7-b825-c7649403e83b","resolution":{"observed_at":"2026-08-15T17:15:20.724340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-16T17:25:16.004651Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-05T16:31:34.309538Z","title":"Available: https://arxiv.org/abs/2201.12086 10","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.18430","last_updated":"2025-08-25T19:22:16Z","snapshot_observed_at":"2026-08-13T20:43:30.915084Z","submitted_at":"2025-08-25T19:22:16Z","title":"CLARIFY: A Specialist-Generalist Framework for Accurate and Lightweight Dermatological Visual Question Answering","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-05T16:31:34.309538Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2508.18430"},"observation_digest":"sha256:560f62f7530e94a2fb72abedd5874742ae69002df689dc57c76c315169d8c320","observation_id":"1d3e5fda-c22c-4f56-903e-f830935e267a","resolution":{"observed_at":"2026-08-05T16:31:34.309538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-16T17:25:16.004651Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-05T05:01:36.801004Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Gen- eration.ArXiv, 2201.12086, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-15T05:55:38.630847Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.801004Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:e8c4673e005397d778a32990cb091fae903bf8938d8fc73d251ca58720602f83","observation_id":"655e029f-4504-4828-b44b-460328908220","resolution":{"observed_at":"2026-08-05T05:01:36.801004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-16T17:25:16.004651Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-04T21:25:26.951332Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Gen- eration.ArXiv, 2201.12086, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-15T13:12:57.491333Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:26.951332Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:450a95bfec5dc02611a82a26a00c913c1aaf8b42499807163de1737477dda122","observation_id":"41c23dbc-f4c8-4775-a078-abb7d87613f1","resolution":{"observed_at":"2026-08-04T21:25:26.951332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-16T17:25:16.004651Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-15T15:46:43.290470Z","title":"In: Internati onal Con- ference on Machine Learning, pp","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.24342","last_updated":"2026-07-03T03:57:58Z","snapshot_observed_at":"2026-08-17T23:23:55.126263Z","submitted_at":"2025-10-28T12:09:23Z","title":"A Unified Geometric Space for Topological Alignment Between Transformer-Based Models and Human Brain Networks","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T15:46:43.290470Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2510.24342"},"observation_digest":"sha256:8da1e4a2e79c90f3396c48be408543ec97fa4633f696571f3b3eff83c2fb0eaf","observation_id":"61c6fe04-d733-4125-b9a2-cb1e1d278238","resolution":{"observed_at":"2026-08-15T15:46:43.290470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-16T17:25:16.004651Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2201.12086","doi":"10.48550/arxiv.2201.12086","metadata_source":"pith","pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Blip: Bootstrapping language- image pre-training for uniﬁed vision-language understanding and generation","venue":"cs.CV","work_id":"ed5a5938-1f3b-44a9-9543-ebafa9af4d53","year":2022},"citing_paper":{"arxiv_id":"2511.00181","last_updated":"2026-04-07T09:06:09Z","snapshot_observed_at":"2026-08-14T22:01:59.522171Z","submitted_at":"2025-10-31T18:36:49Z","title":"From Evidence to Verdict: An Agent-Based Forensic Framework for AI-Generated Image Detection","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-18T02:04:49.742067Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2511.00181"},"observation_digest":"sha256:2879f9af882a691968b18bf28a1d5d6f02267b7249b963ac4b45ea6f008079e4","observation_id":"11c336d3-959d-44cc-9a77-7db3680058be","resolution":{"observed_at":"2026-05-18T02:05:39.015725Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-16T17:25:16.004651Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-02T19:41:32.979486Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.01471","last_updated":"2026-06-02T03:52:48Z","snapshot_observed_at":"2026-08-16T06:32:09.754502Z","submitted_at":"2026-03-02T05:34:45Z","title":"Reconstructing Content with Collaborative Attention for Universal Multimodal Representation Learning","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T19:41:32.979486Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2603.01471"},"observation_digest":"sha256:d334d1ae3572e14bba6fb2716d1a49830613eb8531f352c0d279b44caf30ad66","observation_id":"b2e4e563-2655-4094-8662-b19d6a1d9943","resolution":{"observed_at":"2026-08-02T19:41:32.979486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-16T17:25:16.004651Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2201.12086","doi":"10.48550/arxiv.2201.12086","metadata_source":"pith","pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Blip: Bootstrapping language- image pre-training for uniﬁed vision-language understanding and generation","venue":"cs.CV","work_id":"ed5a5938-1f3b-44a9-9543-ebafa9af4d53","year":2022},"citing_paper":{"arxiv_id":"2604.05210","last_updated":"2026-04-06T22:10:05Z","snapshot_observed_at":"2026-08-13T23:00:03.265396Z","submitted_at":"2026-04-06T22:10:05Z","title":"Integration of Object Detection and Small VLMs for Construction Safety Hazard Identification","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T19:20:29.951227Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2604.05210"},"observation_digest":"sha256:ef3fc590286fc2d9778816568f05e4d694d007f25eb5dacf6d4d794a833fa0d5","observation_id":"82e03fb2-6006-4174-af81-e88bbc74baa0","resolution":{"observed_at":"2026-05-10T19:20:44.268586Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-16T17:25:16.004651Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2201.12086","doi":"10.48550/arxiv.2201.12086","metadata_source":"pith","pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Blip: Bootstrapping language- image pre-training for uniﬁed vision-language understanding and generation","venue":"cs.CV","work_id":"ed5a5938-1f3b-44a9-9543-ebafa9af4d53","year":2022},"citing_paper":{"arxiv_id":"2604.05900","last_updated":"2026-04-07T14:05:17Z","snapshot_observed_at":"2026-08-11T11:00:13.923794Z","submitted_at":"2026-04-07T14:05:17Z","title":"AICA-Bench: Holistically Examining the Capabilities of VLMs in Affective Image Content Analysis","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-10T19:22:08.306946Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2604.05900"},"observation_digest":"sha256:bc035c85e96c9673d1d9a08fe4489d30b2aa109adc6a5dc14b3abb0885eb6846","observation_id":"c3e09fb9-415b-4a57-a46d-647ff857880e","resolution":{"observed_at":"2026-05-10T19:25:45.504493Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-16T17:25:16.004651Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2201.12086","doi":"10.48550/arxiv.2201.12086","metadata_source":"pith","pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Blip: Bootstrapping language- image pre-training for uniﬁed vision-language understanding and generation","venue":"cs.CV","work_id":"ed5a5938-1f3b-44a9-9543-ebafa9af4d53","year":2022},"citing_paper":{"arxiv_id":"2604.18167","last_updated":"2026-04-20T12:28:41Z","snapshot_observed_at":"2026-08-15T00:21:43.819204Z","submitted_at":"2026-04-20T12:28:41Z","title":"Embedding Arithmetic: A Lightweight, Tuning-Free Framework for Post-hoc Bias Mitigation in Text-to-Image Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T05:20:47.706677Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2604.18167"},"observation_digest":"sha256:79c16dce694fe2540aeb70c3fd2870624fab40d02e202782170182cbbb613f41","observation_id":"341e3caf-34c9-43a7-9d22-9bd5d07907b8","resolution":{"observed_at":"2026-05-10T05:20:53.927787Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-16T17:25:16.004651Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2201.12086","doi":"10.48550/arxiv.2201.12086","metadata_source":"pith","pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Blip: Bootstrapping language- image pre-training for uniﬁed vision-language understanding and generation","venue":"cs.CV","work_id":"ed5a5938-1f3b-44a9-9543-ebafa9af4d53","year":2022},"citing_paper":{"arxiv_id":"2604.18347","last_updated":"2026-06-05T18:16:54Z","snapshot_observed_at":"2026-08-08T13:31:57.933715Z","submitted_at":"2026-04-20T14:42:47Z","title":"Multilingual Training and Evaluation Resources for Vision-Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T05:11:00.461167Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2604.18347"},"observation_digest":"sha256:df933a1b8913bc919ddf2f8fe5d7b98080c15e08e4f4cc15682ea42fff01feb1","observation_id":"891678bb-4bed-4fe6-b490-199c6925d33a","resolution":{"observed_at":"2026-05-10T09:38:43.188960Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-16T17:25:16.004651Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2201.12086","doi":"10.48550/arxiv.2201.12086","metadata_source":"pith","pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Blip: Bootstrapping language- image pre-training for uniﬁed vision-language understanding and generation","venue":"cs.CV","work_id":"ed5a5938-1f3b-44a9-9543-ebafa9af4d53","year":2022},"citing_paper":{"arxiv_id":"2604.18347","last_updated":"2026-06-05T18:16:54Z","snapshot_observed_at":"2026-08-08T13:31:57.933715Z","submitted_at":"2026-04-20T14:42:47Z","title":"Multilingual Training and Evaluation Resources for Vision-Language Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-05T12:25:00.027624Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2604.18347"},"observation_digest":"sha256:4f8d6784882aacf125bded79d4bc5422acb1359d5ce73c8c8978cb8c9dddaf6a","observation_id":"6d6ce162-132d-45d7-be0c-2a148a666db9","resolution":{"observed_at":"2026-07-05T12:30:59.881443Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-16T17:25:16.004651Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2201.12086","doi":"10.48550/arxiv.2201.12086","metadata_source":"pith","pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Blip: Bootstrapping language- image pre-training for uniﬁed vision-language understanding and generation","venue":"cs.CV","work_id":"ed5a5938-1f3b-44a9-9543-ebafa9af4d53","year":2022},"citing_paper":{"arxiv_id":"2605.17669","last_updated":"2026-05-17T22:02:35Z","snapshot_observed_at":"2026-08-14T18:00:47.925982Z","submitted_at":"2026-05-17T22:02:35Z","title":"Multimodal Cultural Heritage Knowledge Graph Extension with Language and Vision Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-20T12:08:49.134704Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2605.17669"},"observation_digest":"sha256:83e77b138b812ee9528fe9c107a6185f5ea7d28de57ed0562c5d36fb3ed3d87a","observation_id":"cd14dc1d-a1ca-45a7-978d-62e056e5a4ad","resolution":{"observed_at":"2026-05-20T12:13:15.851655Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-16T17:25:16.004651Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2201.12086","doi":"10.48550/arxiv.2201.12086","metadata_source":"pith","pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Blip: Bootstrapping language- image pre-training for uniﬁed vision-language understanding and generation","venue":"cs.CV","work_id":"ed5a5938-1f3b-44a9-9543-ebafa9af4d53","year":2022},"citing_paper":{"arxiv_id":"2605.24938","last_updated":"2026-05-24T08:36:34Z","snapshot_observed_at":"2026-08-14T12:17:04.501726Z","submitted_at":"2026-05-24T08:36:34Z","title":"Your Embedding Model is SMARTer Than You Think","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-29T23:56:28.774601Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2605.24938"},"observation_digest":"sha256:79b0d17ba06e11d7c6fcbe9affd4a87797360f881cdc0f5dccdb40b6215fb6cd","observation_id":"fc76c320-8bfe-4b6b-810d-29a832473dcb","resolution":{"observed_at":"2026-06-30T00:04:06.374816Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-16T17:25:16.004651Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2201.12086","doi":"10.48550/arxiv.2201.12086","metadata_source":"pith","pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Blip: Bootstrapping language- image pre-training for uniﬁed vision-language understanding and generation","venue":"cs.CV","work_id":"ed5a5938-1f3b-44a9-9543-ebafa9af4d53","year":2022},"citing_paper":{"arxiv_id":"2605.30168","last_updated":"2026-05-28T16:20:18Z","snapshot_observed_at":"2026-08-08T09:45:09.872402Z","submitted_at":"2026-05-28T16:20:18Z","title":"OmniCD: A Foundational Framework for Remote Sensing Image Change Detection Guided by Multimodal Semantics","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-29T08:03:27.451288Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2605.30168"},"observation_digest":"sha256:46c5d6e5fc1ed590146297eb74862c12a198a45fead1d5064a38a78d3a33ff6d","observation_id":"3dd66f37-397d-40bd-92c5-55920bfd4cf1","resolution":{"observed_at":"2026-06-29T08:13:16.026784Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-16T17:25:16.004651Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-02T04:33:53.163084Z","title":"Junnan Li, Dongxu Li, Silvio Savarese, and Steven Hoi","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13660","last_updated":"2026-07-15T10:05:53Z","snapshot_observed_at":"2026-08-16T05:33:21.550232Z","submitted_at":"2026-07-15T10:05:53Z","title":"The Hyperspherical Geometry of CLIP Latent Space: A Semantic Mixture Model","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T04:33:53.163084Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2607.13660"},"observation_digest":"sha256:e243f02d56e38062def97850e239a0236ae995079967ae63c20f8142281a0366","observation_id":"827aa6c2-e4df-4fb1-9d36-aa21469e321e","resolution":{"observed_at":"2026-08-02T04:33:53.163084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-16T17:25:16.004651Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-07-31T23:59:16.410456Z","title":"Blip: Bootstrapping language-image pre-training for uni- fied vision-language understanding and generation.arXiv preprint arXiv:2201.12086, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23265","last_updated":"2026-08-03T14:35:14Z","snapshot_observed_at":"2026-08-15T21:35:01.894426Z","submitted_at":"2026-07-25T16:05:22Z","title":"WaveZip: Wavelet-Driven Space-Time Decoupling for Video Token Condensation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-31T23:59:16.410456Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2607.23265"},"observation_digest":"sha256:e7d5312b08d445b7ae003dc4cfde6db1b31bb1cdc5272bb88bc0e5c5690eee16","observation_id":"acaad2c7-d8e6-4322-b728-6dcd62b80b01","resolution":{"observed_at":"2026-07-31T23:59:16.410456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-16T17:25:16.004651Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-04T04:01:48.529655Z","title":"Blip: Bootstrapping language-image pre-training for uni- fied vision-language understanding and generation.arXiv preprint arXiv:2201.12086, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23265","last_updated":"2026-08-03T14:35:14Z","snapshot_observed_at":"2026-08-15T21:35:01.894426Z","submitted_at":"2026-07-25T16:05:22Z","title":"WaveZip: Wavelet-Driven Space-Time Decoupling for Video Token Condensation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T04:01:48.529655Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2607.23265"},"observation_digest":"sha256:27a9ce9ca88e06a601fa2e96861a7fcb6b9f1942250710a23e11b2e14b11ced4","observation_id":"0ad61f7e-cc04-463a-a242-3cbd1623810a","resolution":{"observed_at":"2026-08-04T04:01:48.529655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-16T17:25:16.004651Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-07-31T01:59:33.144686Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.25078","last_updated":"2026-07-27T21:13:29Z","snapshot_observed_at":"2026-08-15T11:30:20.610798Z","submitted_at":"2026-07-27T21:13:29Z","title":"Diff-ID: Identity Consistent Facial Image Generation and Morphing via Diffusion Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-31T01:59:33.144686Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2607.25078"},"observation_digest":"sha256:7314833080bacc6f9c5196fab923390443f3afac8e7ee88ce00f134f3f19a717","observation_id":"ff6b00fc-c954-4d5a-b5a3-6c3758cf700e","resolution":{"observed_at":"2026-07-31T01:59:33.144686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2201.12086/citation-record","integrity":"/paper/2201.12086/integrity","json":"/paper/2201.12086/citation-record.json","paper":"/paper/2201.12086"},"outbound":[],"paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T17:25:16.004651Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 75 inbound Pith citation observations for arXiv:2201.12086."}