{"as_of":"2026-08-16T08:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:22efbd3606adab8ec96aacd90485ed9222257ae967ea367265e369027df52278","coverage":[{"denominator":22,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T15:02:23.305959Z","state":"measured"},{"denominator":22,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":22,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.11396/citation-record","integrity":"/paper/2412.11396/integrity","json":"/paper/2412.11396/citation-record.json","paper":"/paper/2412.11396"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:02:23.191882Z","title":"In: Gold- berg, Y., Kozareva, Z., Zhang, Y","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.11396","last_updated":"2024-12-16T02:52:19Z","snapshot_observed_at":"2026-08-15T11:33:49.172073Z","submitted_at":"2024-12-16T02:52:19Z","title":"Leveraging Retrieval-Augmented Tags for Large Vision-Language Understanding in Complex Scenes","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T15:02:23.191882Z"},"links":{"citing_paper":"/paper/2412.11396"},"observation_digest":"sha256:fecf1c57902ff274517013fa528680dd12acbd3ad0932fdb0b25877209cd95e9","observation_id":"c44423f8-885c-44e4-9be8-222d7bb39dc7","resolution":{"observed_at":"2026-08-11T15:02:23.191882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10839","last_updated":"2024-11-12T05:33:05Z","snapshot_observed_at":"2026-08-12T23:41:52.025487Z","submitted_at":"2024-06-16T08:20:12Z","title":"Reminding Multimodal Large Language Models of Object-aware Knowledge with Retrieved Tags","version":3},"cited_work":{"arxiv_id":"2406.10839","doi":"10.48550/arxiv.2406.10839","metadata_source":"pith","pith_arxiv_id":"2406.10839","snapshot_observed_at":"2026-08-11T18:16:15.004306Z","title":"Reminding Multimodal Large Language Models of Object-aware Knowledge with Retrieved Tags","venue":"cs.CV","work_id":"50ee8972-c572-4cbe-8acc-856e9055a448","year":2024},"citing_paper":{"arxiv_id":"2412.11396","last_updated":"2024-12-16T02:52:19Z","snapshot_observed_at":"2026-08-15T11:33:49.172073Z","submitted_at":"2024-12-16T02:52:19Z","title":"Leveraging Retrieval-Augmented Tags for Large Vision-Language Understanding in Complex Scenes","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T15:02:23.197396Z"},"links":{"cited_paper":"/paper/2406.10839","citing_paper":"/paper/2412.11396"},"observation_digest":"sha256:644788d645a4ad74531edf86a9fa3c433f4827ba26ebe816cde51419edb0786f","observation_id":"8df79f80-f676-46c1-8f88-4f1c50adc7f9","resolution":{"observed_at":"2026-08-11T15:02:23.425177Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:02:23.745904Z","title":"In: Krause, A., Brunskill, E., Cho, K., Enge lhardt, B., Sabato, S., Scarlett, J","venue":null,"work_id":"3331a7ac-8868-4b90-b997-c90fcd4210d7","year":2023},"citing_paper":{"arxiv_id":"2412.11396","last_updated":"2024-12-16T02:52:19Z","snapshot_observed_at":"2026-08-15T11:33:49.172073Z","submitted_at":"2024-12-16T02:52:19Z","title":"Leveraging Retrieval-Augmented Tags for Large Vision-Language Understanding in Complex Scenes","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T15:02:23.202468Z"},"links":{"citing_paper":"/paper/2412.11396"},"observation_digest":"sha256:09234c784221d9153c2784c183147b9ce52a39a48a9501d539c2163525a8c692","observation_id":"79725cf8-9740-479a-9ea1-60e64f91eb80","resolution":{"observed_at":"2026-08-11T15:02:23.753606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:02:23.728703Z","title":"In: Proceedings of the 17th Conference of the Eu ropean Chapter of the Association for Computational Linguistics","venue":null,"work_id":"0f334e6b-e558-44f3-a938-f90f363284cb","year":2023},"citing_paper":{"arxiv_id":"2412.11396","last_updated":"2024-12-16T02:52:19Z","snapshot_observed_at":"2026-08-15T11:33:49.172073Z","submitted_at":"2024-12-16T02:52:19Z","title":"Leveraging Retrieval-Augmented Tags for Large Vision-Language Understanding in Complex Scenes","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T15:02:23.207057Z"},"links":{"citing_paper":"/paper/2412.11396"},"observation_digest":"sha256:adbf286eeb2ac7f4db22db02ec5e1853ee146612af842ec923c96b55a1903bc7","observation_id":"c8a35adb-04b1-4a50-a56b-dacada09c633","resolution":{"observed_at":"2026-08-11T15:02:23.733656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19732","last_updated":"2024-12-20T16:19:17Z","snapshot_observed_at":"2026-08-14T06:22:20.361501Z","submitted_at":"2024-10-25T17:59:09Z","title":"Rethinking Visual Dependency in Long-Context Reasoning for Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.19732","snapshot_observed_at":"2026-08-11T15:02:23.211881Z","title":"arXiv preprin t arXiv:2410.19732 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11396","last_updated":"2024-12-16T02:52:19Z","snapshot_observed_at":"2026-08-15T11:33:49.172073Z","submitted_at":"2024-12-16T02:52:19Z","title":"Leveraging Retrieval-Augmented Tags for Large Vision-Language Understanding in Complex Scenes","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T15:02:23.211881Z"},"links":{"cited_paper":"/paper/2410.19732","citing_paper":"/paper/2412.11396"},"observation_digest":"sha256:f2d0a73ac28341188661eca01ae8063820c65d870f1bc78be4d22146ccbc8c12","observation_id":"1750bb6b-8846-4c6b-af9b-a4d987990dcc","resolution":{"observed_at":"2026-08-11T15:02:23.211881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:02:23.710615Z","title":"In: Findings of the Association for Comput ational Linguistics, ACL 2024, Bangkok, Thailand and virtual meeting, August 11- 16, 2024","venue":null,"work_id":"bb6c3765-a7cd-42d2-9134-b20b819768d7","year":2024},"citing_paper":{"arxiv_id":"2412.11396","last_updated":"2024-12-16T02:52:19Z","snapshot_observed_at":"2026-08-15T11:33:49.172073Z","submitted_at":"2024-12-16T02:52:19Z","title":"Leveraging Retrieval-Augmented Tags for Large Vision-Language Understanding in Complex Scenes","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T15:02:23.217477Z"},"links":{"citing_paper":"/paper/2412.11396"},"observation_digest":"sha256:ad2a967a5d1750f714a5910fb7f2a53fb5a698d5214583e09858a12fec681923","observation_id":"1ae961f3-1ee4-435c-b66a-1bb38611e1e2","resolution":{"observed_at":"2026-08-11T15:02:23.716292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:02:23.694219Z","title":"In: Findings of the Association for Computational Ling uistics: EACL 2023","venue":null,"work_id":"3252578a-4cfc-4a90-8dc7-ac4c1db6d964","year":2023},"citing_paper":{"arxiv_id":"2412.11396","last_updated":"2024-12-16T02:52:19Z","snapshot_observed_at":"2026-08-15T11:33:49.172073Z","submitted_at":"2024-12-16T02:52:19Z","title":"Leveraging Retrieval-Augmented Tags for Large Vision-Language Understanding in Complex Scenes","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T15:02:23.223857Z"},"links":{"citing_paper":"/paper/2412.11396"},"observation_digest":"sha256:7d201291d1355894aa8f1a5b8e6e5235b1612ca3f8ee1fecc68c684ad99e1ec3","observation_id":"525537a2-f56c-40d0-a742-1c6a16bfa4f5","resolution":{"observed_at":"2026-08-11T15:02:23.699918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:02:23.229370Z","title":"In: Findings of the Associ ation for Computational Linguistics: ACL 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11396","last_updated":"2024-12-16T02:52:19Z","snapshot_observed_at":"2026-08-15T11:33:49.172073Z","submitted_at":"2024-12-16T02:52:19Z","title":"Leveraging Retrieval-Augmented Tags for Large Vision-Language Understanding in Complex Scenes","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T15:02:23.229370Z"},"links":{"citing_paper":"/paper/2412.11396"},"observation_digest":"sha256:0f730b765b9db24d46a61da69910b458460c7551938c2849d7c4cf9522889ac5","observation_id":"e0c1e7c9-a6ee-4500-843e-89878219bd55","resolution":{"observed_at":"2026-08-11T15:02:23.229370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:02:23.234520Z","title":"In : Proceedings of the AAAI Conference on Artiﬁcial Intelligence","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11396","last_updated":"2024-12-16T02:52:19Z","snapshot_observed_at":"2026-08-15T11:33:49.172073Z","submitted_at":"2024-12-16T02:52:19Z","title":"Leveraging Retrieval-Augmented Tags for Large Vision-Language Understanding in Complex Scenes","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T15:02:23.234520Z"},"links":{"citing_paper":"/paper/2412.11396"},"observation_digest":"sha256:23fe0de7171c3f7795ce329573c56e817d3b3526e447cd85b3f1f8705877f65f","observation_id":"191b4070-d104-4d94-8f3c-489bb9b5f391","resolution":{"observed_at":"2026-08-11T15:02:23.234520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:02:23.660003Z","title":"In: International confer- ence on machine learning","venue":null,"work_id":"70d470db-0018-4005-a0aa-742401b79785","year":2022},"citing_paper":{"arxiv_id":"2412.11396","last_updated":"2024-12-16T02:52:19Z","snapshot_observed_at":"2026-08-15T11:33:49.172073Z","submitted_at":"2024-12-16T02:52:19Z","title":"Leveraging Retrieval-Augmented Tags for Large Vision-Language Understanding in Complex Scenes","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T15:02:23.239294Z"},"links":{"citing_paper":"/paper/2412.11396"},"observation_digest":"sha256:828436b88045b431e535e00d99cb107551268acabc02ddfa1a190b829990cce2","observation_id":"59d8c182-bd55-4414-8dea-36d1cc1d3839","resolution":{"observed_at":"2026-08-11T15:02:23.665352Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-08-13T18:58:34.541884Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-08-11T15:02:23.245449Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11396","last_updated":"2024-12-16T02:52:19Z","snapshot_observed_at":"2026-08-15T11:33:49.172073Z","submitted_at":"2024-12-16T02:52:19Z","title":"Leveraging Retrieval-Augmented Tags for Large Vision-Language Understanding in Complex Scenes","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T15:02:23.245449Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2412.11396"},"observation_digest":"sha256:79f9c2ca1fa982768779673b29f3ca5b57937b1f527619111c524a99cbeedb6f","observation_id":"9b64a958-ae5d-4437-b526-841b1381d5cc","resolution":{"observed_at":"2026-08-11T15:02:23.245449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:02:23.645478Z","title":"In: Oh, A., Naumann, T., Glo berson, A., Saenko, K., Hardt, M., Levine, S","venue":null,"work_id":"53396014-ed4b-46d0-81fb-b9059cf8de14","year":2023},"citing_paper":{"arxiv_id":"2412.11396","last_updated":"2024-12-16T02:52:19Z","snapshot_observed_at":"2026-08-15T11:33:49.172073Z","submitted_at":"2024-12-16T02:52:19Z","title":"Leveraging Retrieval-Augmented Tags for Large Vision-Language Understanding in Complex Scenes","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T15:02:23.252442Z"},"links":{"citing_paper":"/paper/2412.11396"},"observation_digest":"sha256:6513d008198de581e2b3644f450fa8477e582eef878ad081e8d460414f26d861","observation_id":"4996202a-9291-4e88-9038-0737510d766d","resolution":{"observed_at":"2026-08-11T15:02:23.650212Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14238","last_updated":"2024-01-15T15:23:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-21T18:59:31Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14238","snapshot_observed_at":"2026-08-11T15:02:23.256879Z","title":"CoRR abs/2312.14238 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11396","last_updated":"2024-12-16T02:52:19Z","snapshot_observed_at":"2026-08-15T11:33:49.172073Z","submitted_at":"2024-12-16T02:52:19Z","title":"Leveraging Retrieval-Augmented Tags for Large Vision-Language Understanding in Complex Scenes","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T15:02:23.256879Z"},"links":{"cited_paper":"/paper/2312.14238","citing_paper":"/paper/2412.11396"},"observation_digest":"sha256:1c016952dbefc4360a2d543884dd530c1b6f02a2afccb99de4f36ae39233b24f","observation_id":"fc6484dd-47e6-41ce-ad46-f7132074b2b4","resolution":{"observed_at":"2026-08-11T15:02:23.256879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:02:23.262416Z","title":"In: Pro- ceedings of the 2021 Conference of the North American Chapte r of the Associa- tion for Computational Linguistics: Human Language Techno logies","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.11396","last_updated":"2024-12-16T02:52:19Z","snapshot_observed_at":"2026-08-15T11:33:49.172073Z","submitted_at":"2024-12-16T02:52:19Z","title":"Leveraging Retrieval-Augmented Tags for Large Vision-Language Understanding in Complex Scenes","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T15:02:23.262416Z"},"links":{"citing_paper":"/paper/2412.11396"},"observation_digest":"sha256:77b432248889e13a841ab4ec08dabc77d4229855741abfa38cc5f5d4a32db7f6","observation_id":"ccd8abb0-c467-4232-8c81-21890308095f","resolution":{"observed_at":"2026-08-11T15:02:23.262416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:02:23.267112Z","title":": Modeling event- pair relations in external knowledge graphs for script reas oning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.11396","last_updated":"2024-12-16T02:52:19Z","snapshot_observed_at":"2026-08-15T11:33:49.172073Z","submitted_at":"2024-12-16T02:52:19Z","title":"Leveraging Retrieval-Augmented Tags for Large Vision-Language Understanding in Complex Scenes","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T15:02:23.267112Z"},"links":{"citing_paper":"/paper/2412.11396"},"observation_digest":"sha256:f5de2ee5a18c10291be7ec31f11ce90cf8281add6f678d99048dfffaaffa129b","observation_id":"1eaf28fd-90cc-4403-befc-67767904cdd4","resolution":{"observed_at":"2026-08-11T15:02:23.267112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08394","last_updated":"2024-12-31T05:35:05Z","snapshot_observed_at":"2026-08-12T23:44:22.154771Z","submitted_at":"2024-06-12T16:44:50Z","title":"VisionLLM v2: An End-to-End Generalist Multimodal Large Language Model for Hundreds of Vision-Language Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08394","snapshot_observed_at":"2026-08-11T15:02:23.270947Z","title":"CoRR abs/2406.08394 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11396","last_updated":"2024-12-16T02:52:19Z","snapshot_observed_at":"2026-08-15T11:33:49.172073Z","submitted_at":"2024-12-16T02:52:19Z","title":"Leveraging Retrieval-Augmented Tags for Large Vision-Language Understanding in Complex Scenes","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T15:02:23.270947Z"},"links":{"cited_paper":"/paper/2406.08394","citing_paper":"/paper/2412.11396"},"observation_digest":"sha256:6720fc70fb85d7e591181b6a2f84f2436079fc62d6698fe69b357adcdcf5c3be","observation_id":"9f4c610b-c044-42b6-a754-0d0ffa837559","resolution":{"observed_at":"2026-08-11T15:02:23.270947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:02:23.610934Z","title":"In: Cai, J., Kankanhalli, M.S., Prabhakaran, B., Boll, S., Subramanian, R., Zheng, L., Singh, V.K., César , P., Xie, L., Xu, D","venue":null,"work_id":"7070c858-fd7b-4323-adda-9e510588d2cf","year":2024},"citing_paper":{"arxiv_id":"2412.11396","last_updated":"2024-12-16T02:52:19Z","snapshot_observed_at":"2026-08-15T11:33:49.172073Z","submitted_at":"2024-12-16T02:52:19Z","title":"Leveraging Retrieval-Augmented Tags for Large Vision-Language Understanding in Complex Scenes","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T15:02:23.275985Z"},"links":{"citing_paper":"/paper/2412.11396"},"observation_digest":"sha256:a77c82b0e06ba6d3e1be8a5a28cd0e1ca981bbd252819eb4d4dcf4ea18b3a618","observation_id":"ee4e5f92-be7c-4ccd-8e9f-f9154fdc5a6e","resolution":{"observed_at":"2026-08-11T15:02:23.615837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-08-10T21:21:50.749962Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11411","snapshot_observed_at":"2026-08-11T15:02:23.285580Z","title":"CoRR abs/2402.11411 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11396","last_updated":"2024-12-16T02:52:19Z","snapshot_observed_at":"2026-08-15T11:33:49.172073Z","submitted_at":"2024-12-16T02:52:19Z","title":"Leveraging Retrieval-Augmented Tags for Large Vision-Language Understanding in Complex Scenes","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T15:02:23.285580Z"},"links":{"cited_paper":"/paper/2402.11411","citing_paper":"/paper/2412.11396"},"observation_digest":"sha256:e62be8f3feb34935c9fb0ee3232e663c41d067774ef529a244a10fa0a9907fc8","observation_id":"7a0b849a-5ef0-475b-85ba-f424723da061","resolution":{"observed_at":"2026-08-11T15:02:23.285580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10292","last_updated":"2024-10-07T19:13:47Z","snapshot_observed_at":"2026-08-13T01:47:35.713102Z","submitted_at":"2024-05-16T17:50:19Z","title":"Fine-Tuning Large Vision-Language Models as Decision-Making Agents via Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10292","snapshot_observed_at":"2026-08-11T15:02:23.290415Z","title":"CoRR abs/2405.10292 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11396","last_updated":"2024-12-16T02:52:19Z","snapshot_observed_at":"2026-08-15T11:33:49.172073Z","submitted_at":"2024-12-16T02:52:19Z","title":"Leveraging Retrieval-Augmented Tags for Large Vision-Language Understanding in Complex Scenes","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T15:02:23.290415Z"},"links":{"cited_paper":"/paper/2405.10292","citing_paper":"/paper/2412.11396"},"observation_digest":"sha256:42fb204a15687b6473e27f888d582002b9d9f57344261e133ca08f7b0906bc27","observation_id":"14ef6d89-a516-4e00-8e59-0c5756570613","resolution":{"observed_at":"2026-08-11T15:02:23.290415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.09017","last_updated":"2024-08-16T20:55:21Z","snapshot_observed_at":"2026-08-14T19:24:06.181475Z","submitted_at":"2024-08-16T20:55:21Z","title":"Meta Knowledge for Retrieval Augmented Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.09017","snapshot_observed_at":"2026-08-11T15:02:23.295039Z","title":"CoRR abs/2408.09017 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11396","last_updated":"2024-12-16T02:52:19Z","snapshot_observed_at":"2026-08-15T11:33:49.172073Z","submitted_at":"2024-12-16T02:52:19Z","title":"Leveraging Retrieval-Augmented Tags for Large Vision-Language Understanding in Complex Scenes","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T15:02:23.295039Z"},"links":{"cited_paper":"/paper/2408.09017","citing_paper":"/paper/2412.11396"},"observation_digest":"sha256:ddff71ff6e037ce5ac8336dff25bee96be02abb7a2313163652e18dc85b315f8","observation_id":"a44c310a-daa2-46a1-a8bd-10804d827395","resolution":{"observed_at":"2026-08-11T15:02:23.295039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v38i17.29837","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:02:23.590854Z","title":"In: Wooldridge, M.J., Dy, J.G., Natarajan, S","venue":null,"work_id":"06037a08-3060-4ef6-89f6-cae06a59109c","year":2024},"citing_paper":{"arxiv_id":"2412.11396","last_updated":"2024-12-16T02:52:19Z","snapshot_observed_at":"2026-08-15T11:33:49.172073Z","submitted_at":"2024-12-16T02:52:19Z","title":"Leveraging Retrieval-Augmented Tags for Large Vision-Language Understanding in Complex Scenes","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T15:02:23.305959Z"},"links":{"citing_paper":"/paper/2412.11396"},"observation_digest":"sha256:de93caa5d0f3bfa7a33d1be6a586e47b29f034bf6bf449fc27d01b0ebe134f13","observation_id":"e7083dd3-a474-4945-a193-6a637e572be6","resolution":{"observed_at":"2026-08-11T15:02:23.595819Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:02:23.281390Z","title":"8845–8854","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11396","last_updated":"2024-12-16T02:52:19Z","snapshot_observed_at":"2026-08-15T11:33:49.172073Z","submitted_at":"2024-12-16T02:52:19Z","title":"Leveraging Retrieval-Augmented Tags for Large Vision-Language Understanding in Complex Scenes","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-11T15:02:23.281390Z"},"links":{"citing_paper":"/paper/2412.11396"},"observation_digest":"sha256:d75886a11047082245253ebcfb139a0589178149f752f9858ada8fff098dfd5e","observation_id":"357f6e0a-625a-4afa-b30c-f72a3bf62267","resolution":{"observed_at":"2026-08-11T15:02:23.281390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.11396","last_updated":"2024-12-16T02:52:19Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T11:33:49.172073Z","submitted_at":"2024-12-16T02:52:19Z","title":"Leveraging Retrieval-Augmented Tags for Large Vision-Language Understanding in Complex Scenes"},"reference_resolution":{"displayed":22,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":13,"verified_exact":1,"verified_fuzzy":7},"total_outbound_references":22},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 22 of 22 outbound references and 0 inbound Pith citation observations for arXiv:2412.11396."}