{"as_of":"2026-08-18T16:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ad09acd3b7a08a88ebbcb6bbaeba14d49ec41034689592ff07973d8cad18e9df","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":54,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T10:31:00.250761Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T19:10:05.334285Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-18T03:59:28.575532Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":"2108.10904","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-07-04T19:10:05.334285Z","title":"arXiv preprint arXiv:2108.10904 , year=","venue":null,"work_id":"d5ac0780-1f7e-430f-84e4-c505e2b1edfb","year":2021},"citing_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-16T09:38:09.427509Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2111.11432"},"observation_digest":"sha256:c6b866f2dd1b4795b22d560db6dcfc4174c4b2bd61990cf001f3c32ca3a621da","observation_id":"c79ce03d-e652-4e1a-9612-2a20441e7ebf","resolution":{"observed_at":"2026-05-16T09:38:09.573674Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-18T03:59:28.575532Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":"2108.10904","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-07-04T19:10:05.334285Z","title":"arXiv preprint arXiv:2108.10904 , year=","venue":null,"work_id":"d5ac0780-1f7e-430f-84e4-c505e2b1edfb","year":2021},"citing_paper":{"arxiv_id":"2204.00598","last_updated":"2022-05-27T17:52:50Z","snapshot_observed_at":"2026-08-13T04:37:51.649726Z","submitted_at":"2022-04-01T17:43:13Z","title":"Socratic Models: Composing Zero-Shot Multimodal Reasoning with Language","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-16T09:50:00.546571Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2204.00598"},"observation_digest":"sha256:b45543f1b1573b53e28bf86d38c2a72d1bba174da451a3fb7666d67f28597a0b","observation_id":"d3e8c198-2f4b-45a5-9024-463d8f5a0c97","resolution":{"observed_at":"2026-05-16T09:50:00.756707Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-18T03:59:28.575532Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":"2108.10904","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-07-04T19:10:05.334285Z","title":"arXiv preprint arXiv:2108.10904 , year=","venue":null,"work_id":"d5ac0780-1f7e-430f-84e4-c505e2b1edfb","year":2021},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-08-17T03:00:38.806206Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":125,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:617dd988715d05b6089f3bb4ca11ac51a2b5816f9f3e883186371278c3af086e","observation_id":"16095bf5-2c75-47be-9efb-9967ab6dc02c","resolution":{"observed_at":"2026-05-12T04:22:30.338088Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-18T03:59:28.575532Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":"2108.10904","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-07-04T19:10:05.334285Z","title":"arXiv preprint arXiv:2108.10904 , year=","venue":null,"work_id":"d5ac0780-1f7e-430f-84e4-c505e2b1edfb","year":2021},"citing_paper":{"arxiv_id":"2205.01917","last_updated":"2022-06-14T00:48:04Z","snapshot_observed_at":"2026-08-13T15:12:42.567441Z","submitted_at":"2022-05-04T07:01:14Z","title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-15T10:53:08.292063Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2205.01917"},"observation_digest":"sha256:357992d96f11f9df024bdf273a713139a84bc9466dc3757b493b02235185c1b2","observation_id":"1e62c38a-c5ba-4473-8fc7-b04d20a8b76c","resolution":{"observed_at":"2026-05-15T10:53:08.385289Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-18T03:59:28.575532Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":"2108.10904","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-07-04T19:10:05.334285Z","title":"arXiv preprint arXiv:2108.10904 , year=","venue":null,"work_id":"d5ac0780-1f7e-430f-84e4-c505e2b1edfb","year":2021},"citing_paper":{"arxiv_id":"2205.06175","last_updated":"2022-11-11T10:04:29Z","snapshot_observed_at":"2026-08-14T09:46:32.787845Z","submitted_at":"2022-05-12T16:03:26Z","title":"A Generalist Agent","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-13T06:24:49.833638Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2205.06175"},"observation_digest":"sha256:02ba9a10fe5118bdf25f9a0add27132c2cd8c7b0c6062ae9bbb56e87d7b3a24d","observation_id":"1611710a-17ef-4a83-a512-ce11cd81fa89","resolution":{"observed_at":"2026-05-13T06:24:49.969674Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-18T03:59:28.575532Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":"2108.10904","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-07-04T19:10:05.334285Z","title":"arXiv preprint arXiv:2108.10904 , year=","venue":null,"work_id":"d5ac0780-1f7e-430f-84e4-c505e2b1edfb","year":2021},"citing_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-08-14T02:29:38.306439Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:30.873360Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2206.10789"},"observation_digest":"sha256:387489db3fadd83943705175df90ecfe3ffbdf76fa86e492e6a979956d5b6b6a","observation_id":"eed7dac8-d443-494c-8abe-df58544933c5","resolution":{"observed_at":"2026-05-12T04:49:31.252855Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-18T03:59:28.575532Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":"2108.10904","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-07-04T19:10:05.334285Z","title":"arXiv preprint arXiv:2108.10904 , year=","venue":null,"work_id":"d5ac0780-1f7e-430f-84e4-c505e2b1edfb","year":2021},"citing_paper":{"arxiv_id":"2207.05608","last_updated":"2022-07-12T15:20:48Z","snapshot_observed_at":"2026-08-17T09:42:08.942018Z","submitted_at":"2022-07-12T15:20:48Z","title":"Inner Monologue: Embodied Reasoning through Planning with Language Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-11T20:10:43.912935Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2207.05608"},"observation_digest":"sha256:593ca160ee523bfe3d08a09539b510969d7b8c118598c27522e1344cfa98742b","observation_id":"150303d5-51e5-4690-8ec8-b4083d854709","resolution":{"observed_at":"2026-05-11T20:10:45.889197Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-18T03:59:28.575532Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":"2108.10904","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-07-04T19:10:05.334285Z","title":"arXiv preprint arXiv:2108.10904 , year=","venue":null,"work_id":"d5ac0780-1f7e-430f-84e4-c505e2b1edfb","year":2021},"citing_paper":{"arxiv_id":"2209.06794","last_updated":"2023-06-05T17:55:12Z","snapshot_observed_at":"2026-08-16T15:49:09.216982Z","submitted_at":"2022-09-14T17:24:07Z","title":"PaLI: A Jointly-Scaled Multilingual Language-Image Model","version":4},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-05-16T09:29:05.956863Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2209.06794"},"observation_digest":"sha256:548a1a0ec5dd54440b96fdc515bc5447de29d4183da4198dc6c6e1f55c02ac99","observation_id":"c47735b6-4b4a-4bc9-a0c3-540ba7b778eb","resolution":{"observed_at":"2026-05-16T09:29:06.091876Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-18T03:59:28.575532Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":"2108.10904","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-07-04T19:10:05.334285Z","title":"arXiv preprint arXiv:2108.10904 , year=","venue":null,"work_id":"d5ac0780-1f7e-430f-84e4-c505e2b1edfb","year":2021},"citing_paper":{"arxiv_id":"2303.16199","last_updated":"2024-09-18T23:54:36Z","snapshot_observed_at":"2026-08-13T10:46:50.834601Z","submitted_at":"2023-03-28T17:59:12Z","title":"LLaMA-Adapter: Efficient Fine-tuning of Language Models with Zero-init Attention","version":3},"reference_index":133,"source":"arxiv_source","source_observed_at":"2026-05-14T23:07:42.245641Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2303.16199"},"observation_digest":"sha256:a931fe5724c45daaac07c2e194a003cf5745d62c59a89f8698627951be32f310","observation_id":"46221846-5e44-4ae2-81cf-afb669f6962e","resolution":{"observed_at":"2026-05-14T23:07:42.982914Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-18T03:59:28.575532Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":"2108.10904","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-07-04T19:10:05.334285Z","title":"arXiv preprint arXiv:2108.10904 , year=","venue":null,"work_id":"d5ac0780-1f7e-430f-84e4-c505e2b1edfb","year":2021},"citing_paper":{"arxiv_id":"2306.13549","last_updated":"2024-11-29T15:51:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T15:21:52Z","title":"A Survey on Multimodal Large Language Models","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-16T02:56:41.658658Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2306.13549"},"observation_digest":"sha256:81a1ff3823623496f34c78e3739247b52670dc73082f1af3bd25a87759b6a7ee","observation_id":"140417e2-36d2-4f70-aac2-476191209903","resolution":{"observed_at":"2026-05-16T02:56:42.300910Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-18T03:59:28.575532Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":"2108.10904","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-07-04T19:10:05.334285Z","title":"arXiv preprint arXiv:2108.10904 , year=","venue":null,"work_id":"d5ac0780-1f7e-430f-84e4-c505e2b1edfb","year":2021},"citing_paper":{"arxiv_id":"2401.03568","last_updated":"2024-01-25T21:20:27Z","snapshot_observed_at":"2026-08-12T12:11:22.336410Z","submitted_at":"2024-01-07T19:11:18Z","title":"Agent AI: Surveying the Horizons of Multimodal Interaction","version":2},"reference_index":290,"source":"arxiv_source","source_observed_at":"2026-05-18T14:25:58.876978Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2401.03568"},"observation_digest":"sha256:55587feb454e0760af5a9279712fdf262dceddb9f200bf31de964e1b6d979022","observation_id":"03da7090-bb13-4508-8d66-f508abdd6740","resolution":{"observed_at":"2026-05-18T14:25:59.818454Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-18T03:59:28.575532Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":"2108.10904","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-07-04T19:10:05.334285Z","title":"arXiv preprint arXiv:2108.10904 , year=","venue":null,"work_id":"d5ac0780-1f7e-430f-84e4-c505e2b1edfb","year":2021},"citing_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-08T07:16:45.596308Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"reference_index":145,"source":"pdf_text","source_observed_at":"2026-05-11T13:10:19.972353Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2407.07726"},"observation_digest":"sha256:3665f51d8aa8d570da5d54c17dc94491d131b33139cc31affb64072ccaa9b7ba","observation_id":"c3724561-48ee-48d5-9eca-06119d69a7ea","resolution":{"observed_at":"2026-05-11T13:10:21.208526Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-18T03:59:28.575532Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-08-12T15:17:22.832620Z","title":"Simvlm: Simple visual language model pretraining with weak supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-16T12:57:42.983932Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":123,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.832620Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:f2bb02a9ec9e77d562519e61afd0a26110cb0739c2bf3d5678262aea0019e754","observation_id":"d040aaa5-320b-4575-bda2-f6a7102b49eb","resolution":{"observed_at":"2026-08-12T15:17:22.832620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-18T03:59:28.575532Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-08-12T15:06:05.090407Z","title":"Simvlm: Simple visual language model pretraining with weak supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-18T03:59:06.951262Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:05.090407Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:a38b48a75f74f7fdc4712c90426e6ad94a178e7b34204ab3a0ff8621be39423c","observation_id":"7c79ed25-29e0-4b4f-a0ea-a4ffcf36494a","resolution":{"observed_at":"2026-08-12T15:06:05.090407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-18T03:59:28.575532Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-08-12T13:29:38.766732Z","title":"Simvlm: Simple visual language model pretraining with weak supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.16789","last_updated":"2025-08-25T12:12:26Z","snapshot_observed_at":"2026-08-17T06:40:16.124985Z","submitted_at":"2024-11-25T09:01:41Z","title":"Leveraging the Power of MLLMs for Gloss-Free Sign Language Translation","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T13:29:38.766732Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2411.16789"},"observation_digest":"sha256:b0a0fb73c22cfca9c568ee3f9abc66b236c3adffedef48c34fbae3d17a0d98d9","observation_id":"fa6ca9c6-ae4c-4d06-b0e6-3e7c3c229a8d","resolution":{"observed_at":"2026-08-12T13:29:38.766732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-18T03:59:28.575532Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-08-11T00:47:52.513342Z","title":"W.; Dai, Z.; Tsvetkov, Y.; and Cao, Y","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-15T16:37:06.956343Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.513342Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:f77854550991686af3dbea527b0a9171ddb83f092893fb33c863bc21910aa643","observation_id":"d03c0505-7d79-4c8e-a6d6-0fb2112b0a24","resolution":{"observed_at":"2026-08-11T00:47:52.513342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-18T03:59:28.575532Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-08-10T22:55:54.246726Z","title":"W., Dai, Z., Tsvetkov, Y., and Cao, Y","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.00569","last_updated":"2025-04-12T02:05:56Z","snapshot_observed_at":"2026-08-16T12:30:25.542232Z","submitted_at":"2024-12-31T17:54:29Z","title":"Probing Visual Language Priors in VLMs","version":4},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-10T22:55:54.246726Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2501.00569"},"observation_digest":"sha256:fa7cd206c476baf732b3db0cd058963602e13a57f896ac9691a8ec63d03cad2b","observation_id":"4b09d050-6986-48eb-8369-c5ac505dc0ce","resolution":{"observed_at":"2026-08-10T22:55:54.246726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-18T03:59:28.575532Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-08-10T22:02:44.047931Z","title":"W.; Dai, Z.; Tsvetkov, Y.; and Cao, Y","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.03053","last_updated":"2025-01-10T15:35:07Z","snapshot_observed_at":"2026-08-12T21:39:50.312526Z","submitted_at":"2025-01-06T14:40:45Z","title":"Dr. Tongue: Sign-Oriented Multi-label Detection for Remote Tongue Diagnosis","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-10T22:02:44.047931Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2501.03053"},"observation_digest":"sha256:0e754d74ca40d4964948f9296e3ea2d809033ca1c88edec320bbe7b69b2454f7","observation_id":"0d8b25b6-e8e4-4b23-92d2-57ddf246af6e","resolution":{"observed_at":"2026-08-10T22:02:44.047931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-18T03:59:28.575532Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-08-10T21:46:28.019525Z","title":"Simvlm: Simple visual language model pretraining with weak supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.03939","last_updated":"2025-01-11T14:21:37Z","snapshot_observed_at":"2026-08-11T03:31:24.809067Z","submitted_at":"2025-01-07T17:00:35Z","title":"Visual question answering: from early developments to recent advances -- a survey","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-10T21:46:28.019525Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2501.03939"},"observation_digest":"sha256:36e522e3e4f6de187a661e79e90d48676ff3a36e808bf5d1d2eb83a964edda80","observation_id":"4e91617f-0f05-4724-9d82-84e584d16b05","resolution":{"observed_at":"2026-08-10T21:46:28.019525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-18T03:59:28.575532Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-08-10T16:19:29.033903Z","title":"Simvlm: Simple visual language model pretraining with weak supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.13341","last_updated":"2025-04-12T12:38:44Z","snapshot_observed_at":"2026-08-17T21:45:57.859085Z","submitted_at":"2025-01-23T02:45:35Z","title":"Multi-aspect Knowledge Distillation with Large Language Model","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T16:19:29.033903Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2501.13341"},"observation_digest":"sha256:7a5227de423c2af7b68e17f5b2ba5f893cba0c5402956f9a9685a196c5317c8f","observation_id":"8631da16-cc6f-4f78-b72b-077e1824f250","resolution":{"observed_at":"2026-08-10T16:19:29.033903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-18T03:59:28.575532Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-08-10T14:36:19.238053Z","title":"Simvlm: Simple visual language model pretraining with weak supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.15177","last_updated":"2026-07-03T16:46:09Z","snapshot_observed_at":"2026-08-14T01:27:57.341623Z","submitted_at":"2025-01-25T11:15:06Z","title":"Audio-Language Models for Audio-Centric Tasks: A Systematic Survey","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T14:36:19.238053Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2501.15177"},"observation_digest":"sha256:2fb663f147ef410ea9c26a29b8efd6ed4ed52c5dd2036ec471ca73effc37e0be","observation_id":"7573674a-1a43-400a-adce-1d9c637b4657","resolution":{"observed_at":"2026-08-10T14:36:19.238053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-18T03:59:28.575532Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-08-07T20:14:03.546300Z","title":"arXiv preprint arXiv:2108.10904 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.09906","last_updated":"2025-02-14T04:29:17Z","snapshot_observed_at":"2026-08-16T18:35:28.339082Z","submitted_at":"2025-02-14T04:29:17Z","title":"Insect-Foundation: A Foundation Model and Large Multimodal Dataset for Vision-Language Insect Understanding","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T20:14:03.546300Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2502.09906"},"observation_digest":"sha256:3c869105f634af20494a233e7a6a8367113befc9afa3b70666488c0d3e11f410","observation_id":"8354bd25-586f-4f95-91f4-16e04aef353f","resolution":{"observed_at":"2026-08-07T20:14:03.546300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-18T03:59:28.575532Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-08-16T10:31:00.250761Z","title":"Simvlm: Simple visual language model pretraining with weak supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-18T05:33:35.492963Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.250761Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:c7383d6ce69b38b06fffffcc683f1f183b7bba05814f3c7a56f47892426e327c","observation_id":"defa57c1-c932-44b8-b1d4-1991733ba014","resolution":{"observed_at":"2026-08-16T10:31:00.250761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-18T03:59:28.575532Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-08-15T23:17:53.650330Z","title":"Simvlm: Simple visual language model pretraining with weak supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.05062","last_updated":"2025-05-08T08:54:57Z","snapshot_observed_at":"2026-08-18T03:59:07.339038Z","submitted_at":"2025-05-08T08:54:57Z","title":"ULFine: Unbiased Lightweight Fine-tuning for Foundation-Model-Assisted Long-Tailed Semi-Supervised Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T23:17:53.650330Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2505.05062"},"observation_digest":"sha256:f0c45f1119df0911d4d77e758fab09e398fd6242cda7211eef75a431845c2a74","observation_id":"7a70b7a4-9f90-4c71-a775-567669f16683","resolution":{"observed_at":"2026-08-15T23:17:53.650330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-18T03:59:28.575532Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-08-15T21:49:28.103319Z","title":"Simvlm: Sim- ple visual language model pretraining with weak supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-18T03:48:18.502258Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:28.103319Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:c2b5ea2ab62ab53dbfb8544dfaca9b9cf9dd4396a7541d0b1ee27e94a0d2a391","observation_id":"d9749ed0-4144-48d1-ad61-70dc9e887f97","resolution":{"observed_at":"2026-08-15T21:49:28.103319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-18T03:59:28.575532Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-08-15T20:32:52.172544Z","title":"Simvlm: Simple visual language model pretraining with weak supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.12670","last_updated":"2025-05-19T03:37:15Z","snapshot_observed_at":"2026-08-18T03:59:24.593487Z","submitted_at":"2025-05-19T03:37:15Z","title":"TS-VLM: Text-Guided SoftSort Pooling for Vision-Language Models in Multi-View Driving Reasoning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T20:32:52.172544Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2505.12670"},"observation_digest":"sha256:a7bb86232cfab1a2f759880da28615e2e06976815f127152b784bf55c4b68ded","observation_id":"38ad1e65-ca51-43e6-965b-2405c02f1d40","resolution":{"observed_at":"2026-08-15T20:32:52.172544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-18T03:59:28.575532Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-08-07T14:59:40.666585Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.16756","last_updated":"2025-05-22T14:59:30Z","snapshot_observed_at":"2026-08-12T18:33:12.606086Z","submitted_at":"2025-05-22T14:59:30Z","title":"Representation Discrepancy Bridging Method for Remote Sensing Image-Text Retrieval","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:59:40.666585Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2505.16756"},"observation_digest":"sha256:52873ab2b1dcf7882beb0e55151c313bb3ec722de02c2775cd28e5d45ae8d87c","observation_id":"16d8b0d0-1aa6-4358-8cfd-db03e911ef78","resolution":{"observed_at":"2026-08-07T14:59:40.666585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-18T03:59:28.575532Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-08-07T12:52:41.477507Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-14T09:09:23.295966Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:41.477507Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:f284dede8e585d4d49b994db720efeca6d49d97ab9cb73549925f664988ec1ba","observation_id":"77bd1637-6379-4ef3-8d25-928d3b36ff97","resolution":{"observed_at":"2026-08-07T12:52:41.477507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-18T03:59:28.575532Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-08-07T05:53:45.667153Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.06884","last_updated":"2025-06-07T18:26:58Z","snapshot_observed_at":"2026-08-18T10:35:09.004104Z","submitted_at":"2025-06-07T18:26:58Z","title":"FREE: Fast and Robust Vision Language Models with Early Exits","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T05:53:45.667153Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2506.06884"},"observation_digest":"sha256:a1e5154c2898357d87190f0fec98170d7ae634a51b66b9342dcad55936738d7f","observation_id":"b0e924db-1927-410b-88be-ec97b3d2c838","resolution":{"observed_at":"2026-08-07T05:53:45.667153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-18T03:59:28.575532Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-08-07T05:40:28.993874Z","title":"OFA: Unifying architec- tures, tasks, and modalities through a simple sequence- to-sequence learning framework","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07484","last_updated":"2025-06-09T07:04:47Z","snapshot_observed_at":"2026-08-18T15:24:16.617865Z","submitted_at":"2025-06-09T07:04:47Z","title":"CoCoA-Mix: Confusion-and-Confidence-Aware Mixture Model for Context Optimization","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T05:40:28.993874Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2506.07484"},"observation_digest":"sha256:83c5d3d9ec4e2476df86996e59d37fa7be2869051bf5c8123c3c368a624b2962","observation_id":"49ce8a1a-37bd-4601-aaeb-0f09e6ec81a7","resolution":{"observed_at":"2026-08-07T05:40:28.993874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-18T03:59:28.575532Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-08-07T05:04:06.395146Z","title":"Simvlm: Simple visual language model pretraining with weak supervision.arXiv preprint arXiv:2108.10904, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.09108","last_updated":"2025-06-10T17:13:09Z","snapshot_observed_at":"2026-08-18T12:19:31.630355Z","submitted_at":"2025-06-10T17:13:09Z","title":"SensorLM: Learning the Language of Wearable Sensors","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:06.395146Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2506.09108"},"observation_digest":"sha256:ddff300a39fc2684df962fb02324467a993af6bd240d5c73debddec043da2836","observation_id":"32f16b24-5e42-4983-ad77-b0bbfb6583fc","resolution":{"observed_at":"2026-08-07T05:04:06.395146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-18T03:59:28.575532Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-08-07T04:44:02.444346Z","title":"Simvlm: Simple visual language model pretraining with weak supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-17T17:54:49.196031Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":178,"source":"arxiv_source","source_observed_at":"2026-08-07T04:44:02.444346Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:e3be5acf528f757a66280539171387aa32b9230ec4af836a3e9c1b98d15a42c3","observation_id":"b92bfa76-840a-4600-bc97-171cba9da0f1","resolution":{"observed_at":"2026-08-07T04:44:02.444346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-18T03:59:28.575532Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-08-07T15:03:51.039188Z","title":"arXiv preprint arXiv:2108.10904 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.11053","last_updated":"2025-05-22T11:23:38Z","snapshot_observed_at":"2026-08-15T18:16:45.806394Z","submitted_at":"2025-05-22T11:23:38Z","title":"Bootstrapping your behavior: a new pretraining strategy for user behavior sequence data","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:51.039188Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2506.11053"},"observation_digest":"sha256:91c4f64a711e991f38bf59fb989202ad71fa30e2a187d2ee86cb0de15d2cd647","observation_id":"940e16ad-a44d-49b6-aea4-fc124200a517","resolution":{"observed_at":"2026-08-07T15:03:51.039188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-18T03:59:28.575532Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-08-15T19:48:42.393029Z","title":"W., et al","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.15090","last_updated":"2025-06-18T02:57:57Z","snapshot_observed_at":"2026-08-18T03:59:05.961596Z","submitted_at":"2025-06-18T02:57:57Z","title":"EMUSE: Evolutionary Map of the Universe Search Engine","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-15T19:48:42.393029Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2506.15090"},"observation_digest":"sha256:ce137cc39d8af53f6fe466c11b0e27cd167880452590a64bff6f05f31c2dabde","observation_id":"63d1dae5-5b86-4d74-9c08-fee914173724","resolution":{"observed_at":"2026-08-15T19:48:42.393029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-18T03:59:28.575532Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-08-06T20:43:03.339629Z","title":"Simvlm: Simple visual language model pretraining with weak supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.02074","last_updated":"2025-09-08T19:23:04Z","snapshot_observed_at":"2026-08-18T03:55:22.502659Z","submitted_at":"2025-07-02T18:21:01Z","title":"Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:03.339629Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2507.02074"},"observation_digest":"sha256:ab6190a4146450df92fb0a20d7eade48d120c32289714f55703296058e685020","observation_id":"354e4939-3157-42f6-b4cd-52aaf15c6c4d","resolution":{"observed_at":"2026-08-06T20:43:03.339629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-18T03:59:28.575532Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-08-06T19:43:45.349914Z","title":"arXiv preprint arXiv:2108.10904 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.04815","last_updated":"2025-07-07T09:33:19Z","snapshot_observed_at":"2026-08-18T01:23:56.843587Z","submitted_at":"2025-07-07T09:33:19Z","title":"From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:45.349914Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2507.04815"},"observation_digest":"sha256:3d1659b9ea1b39532f0bb6bf66a57d459135772a092e1e6f3529c910e2ddc31e","observation_id":"8c065b3a-771b-4689-aae5-c083f0391f89","resolution":{"observed_at":"2026-08-06T19:43:45.349914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-18T03:59:28.575532Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-08-06T18:54:10.057658Z","title":"Simvlm: Simple visual language model pretraining with weak supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.07104","last_updated":"2025-07-11T03:43:50Z","snapshot_observed_at":"2026-08-13T04:04:58.548265Z","submitted_at":"2025-07-09T17:59:04Z","title":"Vision-Language-Vision Auto-Encoder: Scalable Knowledge Distillation from Diffusion Models","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T18:54:10.057658Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2507.07104"},"observation_digest":"sha256:ba0b55e8f116f73cfdb2b192e6a102a698366122328d11c73e430a2bf73d31a8","observation_id":"7feecfc5-30d9-4655-bd45-b597bfe9ae9d","resolution":{"observed_at":"2026-08-06T18:54:10.057658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-18T03:59:28.575532Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-08-06T17:43:53.077148Z","title":"Simvlm: Simple visual language model pretraining with weak supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.10087","last_updated":"2025-07-14T09:13:07Z","snapshot_observed_at":"2026-08-12T18:23:14.296455Z","submitted_at":"2025-07-14T09:13:07Z","title":"Foundation Model Driven Robotics: A Comprehensive Review","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T17:43:53.077148Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2507.10087"},"observation_digest":"sha256:ca10a7cf95af02ec2f9d65aec8da0eb5806dc10a97d79e4d725485eccff7f849","observation_id":"9b31139e-1020-4c3a-ba56-e8306c567ce0","resolution":{"observed_at":"2026-08-06T17:43:53.077148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-18T03:59:28.575532Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-08-06T11:20:07.002898Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.22791","last_updated":"2026-06-11T08:47:41Z","snapshot_observed_at":"2026-08-14T10:09:58.243398Z","submitted_at":"2025-07-30T15:56:36Z","title":"Modality-Aware Feature Matching in Visual and Vision-Language Applications: A Comprehensive Survey","version":2},"reference_index":214,"source":"pdf_text","source_observed_at":"2026-08-06T11:20:07.002898Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2507.22791"},"observation_digest":"sha256:cba62909f5324932668eba0f35b6c451cf6d130b7a82488b3f92bb80957223a9","observation_id":"2a718101-06aa-46d8-a604-39b2520da10e","resolution":{"observed_at":"2026-08-06T11:20:07.002898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-18T03:59:28.575532Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-08-05T23:46:58.076344Z","title":"arXiv preprint arXiv:2108.10904 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.04942","last_updated":"2025-08-07T00:08:31Z","snapshot_observed_at":"2026-08-16T05:16:04.314937Z","submitted_at":"2025-08-07T00:08:31Z","title":"Accelerating Conditional Prompt Learning via Masked Image Modeling for Vision-Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T23:46:58.076344Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2508.04942"},"observation_digest":"sha256:f1a5cf89d0ed7b54575ffaa004e3c97bca5b7172e39160751c39c01921c3e803","observation_id":"57360d68-7f3d-4b8d-bc83-b0b18d956ae8","resolution":{"observed_at":"2026-08-05T23:46:58.076344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-18T03:59:28.575532Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-08-04T13:38:37.414051Z","title":"Simvlm: Sim- ple visual language model pretraining with weak supervision.arXiv preprint arXiv:2108.10904,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.25991","last_updated":"2026-07-30T02:00:42Z","snapshot_observed_at":"2026-08-15T02:25:48.569686Z","submitted_at":"2025-09-30T09:26:32Z","title":"Towards Unified Multimodal Misinformation Detection in Social Media: A Benchmark Dataset and Baseline","version":3},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-04T13:38:37.414051Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2509.25991"},"observation_digest":"sha256:6e00e4a4c5f9edfe1d899f783483e1ae9a09752350c5ac1996976f3ffb872195","observation_id":"c5700a91-3ab5-44d5-b93b-1c8fa37b2bb9","resolution":{"observed_at":"2026-08-04T13:38:37.414051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-18T03:59:28.575532Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":"2108.10904","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-07-04T19:10:05.334285Z","title":"arXiv preprint arXiv:2108.10904 , year=","venue":null,"work_id":"d5ac0780-1f7e-430f-84e4-c505e2b1edfb","year":2021},"citing_paper":{"arxiv_id":"2511.02271","last_updated":"2026-05-14T05:07:16Z","snapshot_observed_at":"2026-08-12T16:04:05.822815Z","submitted_at":"2025-11-04T05:24:52Z","title":"Medical Report Generation: A Hierarchical Task Structure-Based Cross-Modal Causal Intervention Framework","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-18T01:45:29.400398Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2511.02271"},"observation_digest":"sha256:5548554ff82ab62e39d41a3f5b7f1bda35406224d5544de7c51bbc7268a6e83d","observation_id":"a81d2586-752a-418f-a8ad-eab72abd079d","resolution":{"observed_at":"2026-05-18T01:45:36.961944Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-18T03:59:28.575532Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-08-02T17:14:57.572731Z","title":"arXiv preprint arXiv:2108.10904 (2021) 1","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.27556","last_updated":"2026-07-17T03:36:55Z","snapshot_observed_at":"2026-08-09T21:23:21.024647Z","submitted_at":"2026-03-29T07:39:31Z","title":"Towards Domain-Generalized Open-Vocabulary Object Detection: A Progressive Domain-invariant Cross-modal Alignment Method","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-02T17:14:57.572731Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2603.27556"},"observation_digest":"sha256:7b3bd00facdb095b710848d388760efcf657d700eb76ec6d7bd5cff348d0f771","observation_id":"5e42c1d0-96fb-429a-bbdd-c8fbb123c2e5","resolution":{"observed_at":"2026-08-02T17:14:57.572731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-18T03:59:28.575532Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":"2108.10904","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-07-04T19:10:05.334285Z","title":"arXiv preprint arXiv:2108.10904 , year=","venue":null,"work_id":"d5ac0780-1f7e-430f-84e4-c505e2b1edfb","year":2021},"citing_paper":{"arxiv_id":"2604.05583","last_updated":"2026-04-07T08:23:39Z","snapshot_observed_at":"2026-08-13T08:29:24.068288Z","submitted_at":"2026-04-07T08:23:39Z","title":"WRF4CIR: Weight-Regularized Fine-Tuning Network for Composed Image Retrieval","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-10T19:31:53.371412Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2604.05583"},"observation_digest":"sha256:cb3a58d582f0663dcfd60df465dea8ab5bffcb6a2c48102c174665538172c04b","observation_id":"08bb4adf-603c-420a-b56e-f78030cdd1a4","resolution":{"observed_at":"2026-05-10T22:50:50.008483Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-18T03:59:28.575532Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":"2108.10904","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-07-04T19:10:05.334285Z","title":"arXiv preprint arXiv:2108.10904 , year=","venue":null,"work_id":"d5ac0780-1f7e-430f-84e4-c505e2b1edfb","year":2021},"citing_paper":{"arxiv_id":"2604.13970","last_updated":"2026-04-15T15:19:54Z","snapshot_observed_at":"2026-08-16T08:45:20.105987Z","submitted_at":"2026-04-15T15:19:54Z","title":"MApLe: Multi-instance Alignment of Diagnostic Reports and Large Medical Images","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T13:33:02.946839Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2604.13970"},"observation_digest":"sha256:c0f0a03a1b33ad57816d49957cf4c076c45acf2e374fb5b85d39e007329b270a","observation_id":"7830cbe1-7e0c-47c9-b9f5-715b7dc3aaad","resolution":{"observed_at":"2026-05-10T13:35:26.372269Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-18T03:59:28.575532Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":"2108.10904","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-07-04T19:10:05.334285Z","title":"arXiv preprint arXiv:2108.10904 , year=","venue":null,"work_id":"d5ac0780-1f7e-430f-84e4-c505e2b1edfb","year":2021},"citing_paper":{"arxiv_id":"2604.27559","last_updated":"2026-04-30T08:08:46Z","snapshot_observed_at":"2026-08-10T23:52:22.570018Z","submitted_at":"2026-04-30T08:08:46Z","title":"RIHA: Report-Image Hierarchical Alignment for Radiology Report Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-07T10:00:25.846913Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2604.27559"},"observation_digest":"sha256:9457c997e92921a5e62b625522099e2de698f7403b204b4426b685d13d7dc502","observation_id":"6d9a4388-4867-484a-a86d-89a600935572","resolution":{"observed_at":"2026-05-12T09:41:25.994420Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-18T03:59:28.575532Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":"2108.10904","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-07-04T19:10:05.334285Z","title":"arXiv preprint arXiv:2108.10904 , year=","venue":null,"work_id":"d5ac0780-1f7e-430f-84e4-c505e2b1edfb","year":2021},"citing_paper":{"arxiv_id":"2605.00809","last_updated":"2026-06-09T13:08:44Z","snapshot_observed_at":"2026-08-16T17:50:54.118450Z","submitted_at":"2026-05-01T17:51:38Z","title":"Let ViT Speak: Generative Language-Image Pre-training","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-09T18:56:51.627714Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2605.00809"},"observation_digest":"sha256:c4ff28f0db937dfeac5a819a30915fa8ed72c3ad1fa007f2ed1d7851f21d907d","observation_id":"02ec7dbd-701c-485e-bbcb-d116d23e87f8","resolution":{"observed_at":"2026-05-11T16:01:11.367780Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-18T03:59:28.575532Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":"2108.10904","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-07-04T19:10:05.334285Z","title":"arXiv preprint arXiv:2108.10904 , year=","venue":null,"work_id":"d5ac0780-1f7e-430f-84e4-c505e2b1edfb","year":2021},"citing_paper":{"arxiv_id":"2605.00809","last_updated":"2026-06-09T13:08:44Z","snapshot_observed_at":"2026-08-16T17:50:54.118450Z","submitted_at":"2026-05-01T17:51:38Z","title":"Let ViT Speak: Generative Language-Image Pre-training","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-07-01T07:35:07.825460Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2605.00809"},"observation_digest":"sha256:1ec2dc9d0f79ef285bc5a05568dc5bcdfc4a991819337dd055033ef796f51b24","observation_id":"f7df252e-0aa0-48c8-8a74-640ef2e21b82","resolution":{"observed_at":"2026-07-01T07:35:28.761944Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-18T03:59:28.575532Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":"2108.10904","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-07-04T19:10:05.334285Z","title":"arXiv preprint arXiv:2108.10904 , year=","venue":null,"work_id":"d5ac0780-1f7e-430f-84e4-c505e2b1edfb","year":2021},"citing_paper":{"arxiv_id":"2605.24020","last_updated":"2026-05-20T06:11:25Z","snapshot_observed_at":"2026-08-15T04:05:13.774809Z","submitted_at":"2026-05-20T06:11:25Z","title":"Machine Intelligence that Understands Visual and Linguistic Information and Interacts with Humans and Environments","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-30T17:40:33.082748Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2605.24020"},"observation_digest":"sha256:634447aaa235088c2ba6b1b7a373c5d600d3659ea8613f01c1c5984b2c5acff9","observation_id":"b8422f70-2647-45b4-9bfb-232a5327bb6f","resolution":{"observed_at":"2026-06-30T17:44:57.697014Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-18T03:59:28.575532Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":"2108.10904","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-07-04T19:10:05.334285Z","title":"arXiv preprint arXiv:2108.10904 , year=","venue":null,"work_id":"d5ac0780-1f7e-430f-84e4-c505e2b1edfb","year":2021},"citing_paper":{"arxiv_id":"2606.12633","last_updated":"2026-06-10T19:42:03Z","snapshot_observed_at":"2026-08-02T11:20:31.077337Z","submitted_at":"2026-06-10T19:42:03Z","title":"ECA: Efficient Continual Alignment for Open-Ended Image-to-Text Generation","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-06-27T09:45:35.383450Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2606.12633"},"observation_digest":"sha256:0d5800755bff105a23ccaa376b2eb37409a536ff04dd0227519eeffc696bf079","observation_id":"3f559bf9-22c8-41cd-a996-5ea9fef6de58","resolution":{"observed_at":"2026-07-03T10:58:03.089296Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-18T03:59:28.575532Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":"2108.10904","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-07-04T19:10:05.334285Z","title":"arXiv preprint arXiv:2108.10904 , year=","venue":null,"work_id":"d5ac0780-1f7e-430f-84e4-c505e2b1edfb","year":2021},"citing_paper":{"arxiv_id":"2606.18147","last_updated":"2026-06-16T16:45:56Z","snapshot_observed_at":"2026-08-03T00:46:36.791384Z","submitted_at":"2026-06-16T16:45:56Z","title":"WEQA: Wearable hEalth Question Answering with Query-Adaptive Agentic Reasoning","version":1},"reference_index":118,"source":"arxiv_source","source_observed_at":"2026-06-27T00:53:11.223341Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2606.18147"},"observation_digest":"sha256:d3acb010c751c2c87d373144bae9bb8b1fecf27b9a8e61b7c41fa860d02fb11d","observation_id":"c548dcb9-23c9-4aeb-95e7-9b654439f2dc","resolution":{"observed_at":"2026-07-03T21:08:58.489179Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-18T03:59:28.575532Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":"2108.10904","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-07-04T19:10:05.334285Z","title":"arXiv preprint arXiv:2108.10904 , year=","venue":null,"work_id":"d5ac0780-1f7e-430f-84e4-c505e2b1edfb","year":2021},"citing_paper":{"arxiv_id":"2606.25298","last_updated":"2026-06-24T01:59:29Z","snapshot_observed_at":"2026-08-18T03:59:03.524556Z","submitted_at":"2026-06-24T01:59:29Z","title":"KidRisk: Benchmark Dataset for Children Dangerous Action Recognition","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-25T21:38:32.529040Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2606.25298"},"observation_digest":"sha256:35a98e5f3d9aca392179e1016623f01ee68635766db595c7d385c15dbc41c1bf","observation_id":"a2d6d632-ba4e-4dca-a174-d876a3603909","resolution":{"observed_at":"2026-07-04T19:10:05.335820Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-18T03:59:28.575532Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":"2108.10904","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-07-04T19:10:05.334285Z","title":"arXiv preprint arXiv:2108.10904 , year=","venue":null,"work_id":"d5ac0780-1f7e-430f-84e4-c505e2b1edfb","year":2021},"citing_paper":{"arxiv_id":"2606.29431","last_updated":"2026-07-07T03:19:40Z","snapshot_observed_at":"2026-08-13T00:32:16.827563Z","submitted_at":"2026-06-28T14:48:08Z","title":"FADE: Mitigating Hallucinations by Reducing Language-Prior Dominance in Large Vision-Language Models","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-06-30T07:07:00.265141Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2606.29431"},"observation_digest":"sha256:d57fe825fb0958dea874f27ff5f3f0859654cb16e14d1363700f2ff481853b82","observation_id":"8fef56a8-4df4-4064-bd39-324d808df81d","resolution":{"observed_at":"2026-06-30T07:14:21.507790Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-18T03:59:28.575532Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":"2108.10904","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-07-04T19:10:05.334285Z","title":"arXiv preprint arXiv:2108.10904 , year=","venue":null,"work_id":"d5ac0780-1f7e-430f-84e4-c505e2b1edfb","year":2021},"citing_paper":{"arxiv_id":"2606.29431","last_updated":"2026-07-07T03:19:40Z","snapshot_observed_at":"2026-08-13T00:32:16.827563Z","submitted_at":"2026-06-28T14:48:08Z","title":"FADE: Mitigating Hallucinations by Reducing Language-Prior Dominance in Large Vision-Language Models","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-07-02T20:46:16.298898Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2606.29431"},"observation_digest":"sha256:53cabe0a23f05a405a122ecdf3bca3d6700807e2972662f52895849a2e5333aa","observation_id":"87bd443d-8580-4a0d-8b66-6712e854a642","resolution":{"observed_at":"2026-07-02T20:47:22.354415Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2108.10904/citation-record","integrity":"/paper/2108.10904/integrity","json":"/paper/2108.10904/citation-record.json","paper":"/paper/2108.10904"},"outbound":[],"paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T03:59:28.575532Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 54 inbound Pith citation observations for arXiv:2108.10904."}