{"as_of":"2026-08-09T09:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c57f78fc828a8f00ddbc6d503ec84f66abbae4e160292fb4e82b67a9fd37e77d","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":14,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":14,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":14,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:55:28.217225Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T15:29:56.632867Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2205.12005","last_updated":"2022-05-25T05:49:30Z","snapshot_observed_at":"2026-08-06T06:00:24.094085Z","submitted_at":"2022-05-24T11:52:06Z","title":"mPLUG: Effective and Efficient Vision-Language Learning by Cross-modal Skip-connections","version":2},"cited_work":{"arxiv_id":"2205.12005","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2205.12005","snapshot_observed_at":"2026-07-04T15:29:56.632867Z","title":"mplug: Effective and effi- cient vision-language learning by cross-modal skip- connections","venue":null,"work_id":"f403c450-0e41-4f17-8374-90ddfce8682a","year":2022},"citing_paper":{"arxiv_id":"2205.14100","last_updated":"2022-12-15T19:21:35Z","snapshot_observed_at":"2026-08-04T09:31:34.784365Z","submitted_at":"2022-05-27T17:03:38Z","title":"GIT: A Generative Image-to-text Transformer for Vision and Language","version":5},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-16T20:54:07.572136Z"},"links":{"cited_paper":"/paper/2205.12005","citing_paper":"/paper/2205.14100"},"observation_digest":"sha256:2273f4b757f9801b83cb5d3400e33e292a6aba5540b573763c517767a6d6f17c","observation_id":"fe4fe666-abea-4baf-a398-efc8c3d7cea8","resolution":{"observed_at":"2026-05-16T20:54:07.669979Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.12005","last_updated":"2022-05-25T05:49:30Z","snapshot_observed_at":"2026-08-06T06:00:24.094085Z","submitted_at":"2022-05-24T11:52:06Z","title":"mPLUG: Effective and Efficient Vision-Language Learning by Cross-modal Skip-connections","version":2},"cited_work":{"arxiv_id":"2205.12005","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2205.12005","snapshot_observed_at":"2026-07-04T15:29:56.632867Z","title":"mplug: Effective and effi- cient vision-language learning by cross-modal skip- connections","venue":null,"work_id":"f403c450-0e41-4f17-8374-90ddfce8682a","year":2022},"citing_paper":{"arxiv_id":"2308.01390","last_updated":"2023-08-07T17:53:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-02T19:10:23Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-14T01:52:01.163900Z"},"links":{"cited_paper":"/paper/2205.12005","citing_paper":"/paper/2308.01390"},"observation_digest":"sha256:fd01cdc5398a8df6dd7ace164fb3f8dd7495f7004134c11afa7f94f32d52f3cf","observation_id":"cbc7e6ea-4b69-49b7-9690-b57795862f74","resolution":{"observed_at":"2026-05-14T01:52:01.283540Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.12005","last_updated":"2022-05-25T05:49:30Z","snapshot_observed_at":"2026-08-06T06:00:24.094085Z","submitted_at":"2022-05-24T11:52:06Z","title":"mPLUG: Effective and Efficient Vision-Language Learning by Cross-modal Skip-connections","version":2},"cited_work":{"arxiv_id":"2205.12005","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2205.12005","snapshot_observed_at":"2026-07-04T15:29:56.632867Z","title":"mplug: Effective and effi- cient vision-language learning by cross-modal skip- connections","venue":null,"work_id":"f403c450-0e41-4f17-8374-90ddfce8682a","year":2022},"citing_paper":{"arxiv_id":"2403.05135","last_updated":"2024-03-08T08:08:10Z","snapshot_observed_at":"2026-08-04T23:51:18.339338Z","submitted_at":"2024-03-08T08:08:10Z","title":"ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-11T19:43:03.310237Z"},"links":{"cited_paper":"/paper/2205.12005","citing_paper":"/paper/2403.05135"},"observation_digest":"sha256:e6351f8a2933a56e55d39afcf5d4e7b39fe679ce7a40da76731df3a59cebcd39","observation_id":"0547117b-2545-43d3-8918-a74655c7f44c","resolution":{"observed_at":"2026-05-11T19:43:03.449820Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.12005","last_updated":"2022-05-25T05:49:30Z","snapshot_observed_at":"2026-08-06T06:00:24.094085Z","submitted_at":"2022-05-24T11:52:06Z","title":"mPLUG: Effective and Efficient Vision-Language Learning by Cross-modal Skip-connections","version":2},"cited_work":{"arxiv_id":"2205.12005","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2205.12005","snapshot_observed_at":"2026-07-04T15:29:56.632867Z","title":"mplug: Effective and effi- cient vision-language learning by cross-modal skip- connections","venue":null,"work_id":"f403c450-0e41-4f17-8374-90ddfce8682a","year":2022},"citing_paper":{"arxiv_id":"2412.08110","last_updated":"2026-05-07T17:14:28Z","snapshot_observed_at":"2026-08-02T20:28:50.583436Z","submitted_at":"2024-12-11T05:36:18Z","title":"The ART of Composition: Attention-Regularized Training for Compositional Visual Grounding","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-23T07:24:01.527093Z"},"links":{"cited_paper":"/paper/2205.12005","citing_paper":"/paper/2412.08110"},"observation_digest":"sha256:ae002e344736b6575a3685239c00799642fd2b95867f720e00f127534aabc30f","observation_id":"a22d27b4-0d92-4ae2-a3e9-4c5822de9a63","resolution":{"observed_at":"2026-05-23T07:25:28.425941Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.12005","last_updated":"2022-05-25T05:49:30Z","snapshot_observed_at":"2026-08-06T06:00:24.094085Z","submitted_at":"2022-05-24T11:52:06Z","title":"mPLUG: Effective and Efficient Vision-Language Learning by Cross-modal Skip-connections","version":2},"cited_work":{"arxiv_id":"2205.12005","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2205.12005","snapshot_observed_at":"2026-07-04T15:29:56.632867Z","title":"mplug: Effective and effi- cient vision-language learning by cross-modal skip- connections","venue":null,"work_id":"f403c450-0e41-4f17-8374-90ddfce8682a","year":2022},"citing_paper":{"arxiv_id":"2505.12217","last_updated":"2026-05-19T11:31:17Z","snapshot_observed_at":"2026-08-02T21:48:00.406423Z","submitted_at":"2025-05-18T03:32:24Z","title":"HyperCap: Hyperspectral Land Cover Captioning Dataset for Vision Language Models","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-22T15:15:19.523035Z"},"links":{"cited_paper":"/paper/2205.12005","citing_paper":"/paper/2505.12217"},"observation_digest":"sha256:0a8c607e57f426f50c403fec9ef8f15bacde7b6623d3d6be1af5b44fa6908324","observation_id":"23b3c1fa-12d1-4479-8187-630a5c314b33","resolution":{"observed_at":"2026-05-22T15:16:43.715851Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.12005","last_updated":"2022-05-25T05:49:30Z","snapshot_observed_at":"2026-08-06T06:00:24.094085Z","submitted_at":"2022-05-24T11:52:06Z","title":"mPLUG: Effective and Efficient Vision-Language Learning by Cross-modal Skip-connections","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.12005","snapshot_observed_at":"2026-08-07T14:55:28.217225Z","title":"mplug: Effective and efficient vision-language learning by cross-modal skip-connections","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.16915","last_updated":"2026-05-31T14:25:23Z","snapshot_observed_at":"2026-08-07T14:50:38.755910Z","submitted_at":"2025-05-22T17:11:27Z","title":"DetailMaster: Can Your Text-to-Image Model Handle Long Prompts?","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:28.217225Z"},"links":{"cited_paper":"/paper/2205.12005","citing_paper":"/paper/2505.16915"},"observation_digest":"sha256:ae80e8b05ec080ee51b8e97c69de11eaf84d10adc725e830219749d635faa60a","observation_id":"f4722c6c-9f1a-44ad-9e7b-9df5dcc26f57","resolution":{"observed_at":"2026-08-07T14:55:28.217225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.12005","last_updated":"2022-05-25T05:49:30Z","snapshot_observed_at":"2026-08-06T06:00:24.094085Z","submitted_at":"2022-05-24T11:52:06Z","title":"mPLUG: Effective and Efficient Vision-Language Learning by Cross-modal Skip-connections","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.12005","snapshot_observed_at":"2026-08-07T13:28:06.418154Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21863","last_updated":"2025-06-02T21:33:47Z","snapshot_observed_at":"2026-08-08T23:48:27.766636Z","submitted_at":"2025-05-28T01:19:23Z","title":"GETReason: Enhancing Image Context Extraction through Hierarchical Multi-Agent Reasoning","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T13:28:06.418154Z"},"links":{"cited_paper":"/paper/2205.12005","citing_paper":"/paper/2505.21863"},"observation_digest":"sha256:ae99e3c0ee75b0697adf43dd633b8b279bf65328dc45bf5ea1d189a58f4c5189","observation_id":"b0f23c11-628c-4107-8673-7a996920c4ab","resolution":{"observed_at":"2026-08-07T13:28:06.418154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.12005","last_updated":"2022-05-25T05:49:30Z","snapshot_observed_at":"2026-08-06T06:00:24.094085Z","submitted_at":"2022-05-24T11:52:06Z","title":"mPLUG: Effective and Efficient Vision-Language Learning by Cross-modal Skip-connections","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.12005","snapshot_observed_at":"2026-08-06T23:26:59.764651Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.18272","last_updated":"2025-06-23T03:58:09Z","snapshot_observed_at":"2026-08-06T23:20:29.656990Z","submitted_at":"2025-06-23T03:58:09Z","title":"ReFrame: Rectification Framework for Image Explaining Architectures","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T23:26:59.764651Z"},"links":{"cited_paper":"/paper/2205.12005","citing_paper":"/paper/2506.18272"},"observation_digest":"sha256:5b53b5ce28070756309e83a3727b10541c0862a47b8a3f543ba923cb61dc1f3c","observation_id":"0a0b8c8a-8ab5-424b-8abc-6111086bdfc5","resolution":{"observed_at":"2026-08-06T23:26:59.764651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.12005","last_updated":"2022-05-25T05:49:30Z","snapshot_observed_at":"2026-08-06T06:00:24.094085Z","submitted_at":"2022-05-24T11:52:06Z","title":"mPLUG: Effective and Efficient Vision-Language Learning by Cross-modal Skip-connections","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.12005","snapshot_observed_at":"2026-08-06T19:38:19.410901Z","title":"mplug: Effective and efficient vision-language learning by cross-modal skip-connections","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.05056","last_updated":"2025-07-22T07:33:11Z","snapshot_observed_at":"2026-08-07T01:37:44.161175Z","submitted_at":"2025-07-07T14:38:53Z","title":"INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:19.410901Z"},"links":{"cited_paper":"/paper/2205.12005","citing_paper":"/paper/2507.05056"},"observation_digest":"sha256:5d2b57e9ce4b06c1a7e1d1987cf179eff2b1a45ad1900d1f99c379ae41560398","observation_id":"650fe551-ea2f-416f-8532-9aa34c0f1079","resolution":{"observed_at":"2026-08-06T19:38:19.410901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.12005","last_updated":"2022-05-25T05:49:30Z","snapshot_observed_at":"2026-08-06T06:00:24.094085Z","submitted_at":"2022-05-24T11:52:06Z","title":"mPLUG: Effective and Efficient Vision-Language Learning by Cross-modal Skip-connections","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.12005","snapshot_observed_at":"2026-08-05T10:32:46.361810Z","title":"mplug: Effective and efficient vision-language learning by cross-modal skip-connections,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.03961","last_updated":"2025-09-04T07:39:18Z","snapshot_observed_at":"2026-08-05T10:32:45.162720Z","submitted_at":"2025-09-04T07:39:18Z","title":"Multimodal Feature Fusion Network with Text Difference Enhancement for Remote Sensing Change Detection","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-05T10:32:46.361810Z"},"links":{"cited_paper":"/paper/2205.12005","citing_paper":"/paper/2509.03961"},"observation_digest":"sha256:97c910d5d27db402c314e438a8cb78e7684d4b169275a9a53ff8d8f6d29e0f84","observation_id":"1c2d67bd-b0b0-4603-9b6d-329e2e9c975a","resolution":{"observed_at":"2026-08-05T10:32:46.361810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.12005","last_updated":"2022-05-25T05:49:30Z","snapshot_observed_at":"2026-08-06T06:00:24.094085Z","submitted_at":"2022-05-24T11:52:06Z","title":"mPLUG: Effective and Efficient Vision-Language Learning by Cross-modal Skip-connections","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.12005","snapshot_observed_at":"2026-08-04T15:39:36.456455Z","title":"mplug: Effective and efficient vision-language learning by cross-modal skip-connections","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.19244","last_updated":"2026-07-15T22:48:21Z","snapshot_observed_at":"2026-08-04T15:39:16.754746Z","submitted_at":"2025-09-23T17:05:46Z","title":"Lavida-O: Elastic Large Masked Diffusion Models for Unified Multimodal Understanding and Generation","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-04T15:39:36.456455Z"},"links":{"cited_paper":"/paper/2205.12005","citing_paper":"/paper/2509.19244"},"observation_digest":"sha256:8cba5ec9daad37a63025496956b0695646cb7de782ed266e03e7c7262e67e1c6","observation_id":"757067d8-2202-4a58-84c5-823ce07363e1","resolution":{"observed_at":"2026-08-04T15:39:36.456455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.12005","last_updated":"2022-05-25T05:49:30Z","snapshot_observed_at":"2026-08-06T06:00:24.094085Z","submitted_at":"2022-05-24T11:52:06Z","title":"mPLUG: Effective and Efficient Vision-Language Learning by Cross-modal Skip-connections","version":2},"cited_work":{"arxiv_id":"2205.12005","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2205.12005","snapshot_observed_at":"2026-07-04T15:29:56.632867Z","title":"mplug: Effective and effi- cient vision-language learning by cross-modal skip- connections","venue":null,"work_id":"f403c450-0e41-4f17-8374-90ddfce8682a","year":2022},"citing_paper":{"arxiv_id":"2510.20093","last_updated":"2026-04-14T09:32:02Z","snapshot_observed_at":"2026-07-06T22:33:53.834577Z","submitted_at":"2025-10-23T00:27:32Z","title":"StableSketcher: Enhancing Diffusion Model for Pixel-based Sketch Generation via Visual Question Answering Feedback","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-18T05:26:42.034972Z"},"links":{"cited_paper":"/paper/2205.12005","citing_paper":"/paper/2510.20093"},"observation_digest":"sha256:a715610f7eb57dc2e1ba8a62b4769b423b5a22903a991bb428fea8ffb512e9e4","observation_id":"c7014bc0-822a-4cee-8cad-1eca19200620","resolution":{"observed_at":"2026-05-18T05:30:55.380981Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.12005","last_updated":"2022-05-25T05:49:30Z","snapshot_observed_at":"2026-08-06T06:00:24.094085Z","submitted_at":"2022-05-24T11:52:06Z","title":"mPLUG: Effective and Efficient Vision-Language Learning by Cross-modal Skip-connections","version":2},"cited_work":{"arxiv_id":"2205.12005","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2205.12005","snapshot_observed_at":"2026-07-04T15:29:56.632867Z","title":"mplug: Effective and effi- cient vision-language learning by cross-modal skip- connections","venue":null,"work_id":"f403c450-0e41-4f17-8374-90ddfce8682a","year":2022},"citing_paper":{"arxiv_id":"2604.17889","last_updated":"2026-07-12T12:31:32Z","snapshot_observed_at":"2026-08-05T18:05:02.211734Z","submitted_at":"2026-04-20T07:02:10Z","title":"AeroRAG: Structured Multimodal Retrieval-Augmented LLM for Fine-Grained Aerial Visual Reasoning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-10T04:46:22.891034Z"},"links":{"cited_paper":"/paper/2205.12005","citing_paper":"/paper/2604.17889"},"observation_digest":"sha256:6edfe3fefc528e11831899fb1bd3a582d5bc266fb71d7895eb896b10579ad55e","observation_id":"eeb09fb3-51ba-4736-a08f-288dded6a40d","resolution":{"observed_at":"2026-05-10T11:40:19.818843Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.12005","last_updated":"2022-05-25T05:49:30Z","snapshot_observed_at":"2026-08-06T06:00:24.094085Z","submitted_at":"2022-05-24T11:52:06Z","title":"mPLUG: Effective and Efficient Vision-Language Learning by Cross-modal Skip-connections","version":2},"cited_work":{"arxiv_id":"2205.12005","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2205.12005","snapshot_observed_at":"2026-07-04T15:29:56.632867Z","title":"mplug: Effective and effi- cient vision-language learning by cross-modal skip- connections","venue":null,"work_id":"f403c450-0e41-4f17-8374-90ddfce8682a","year":2022},"citing_paper":{"arxiv_id":"2606.24058","last_updated":"2026-06-23T02:05:36Z","snapshot_observed_at":"2026-08-09T05:53:56.323341Z","submitted_at":"2026-06-23T02:05:36Z","title":"VisChronos: Revolutionizing Image Captioning Through Real-Life Events","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-26T01:34:38.597959Z"},"links":{"cited_paper":"/paper/2205.12005","citing_paper":"/paper/2606.24058"},"observation_digest":"sha256:d9df6adbed0bf3d26e42b6f69ca0aed8ee1c36163409a2ce76161aa310bdf008","observation_id":"55733916-8a99-4c15-871f-0e32c9a9a304","resolution":{"observed_at":"2026-07-04T15:29:56.634915Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2205.12005/citation-record","integrity":"/paper/2205.12005/integrity","json":"/paper/2205.12005/citation-record.json","paper":"/paper/2205.12005"},"outbound":[],"paper":{"arxiv_id":"2205.12005","last_updated":"2022-05-25T05:49:30Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-06T06:00:24.094085Z","submitted_at":"2022-05-24T11:52:06Z","title":"mPLUG: Effective and Efficient Vision-Language Learning by Cross-modal Skip-connections"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 14 inbound Pith citation observations for arXiv:2205.12005."}