{"as_of":"2026-08-12T09:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4bf1d3145623c4a136bed43521580194b93eaba65b4865f41773ebee81be68fe","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:46:48.850831Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T01:52:44.785582Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T12:46:56.783735Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.09638","last_updated":"2025-06-11T11:52:27Z","snapshot_observed_at":"2026-08-09T02:22:54.050557Z","submitted_at":"2025-06-11T11:52:27Z","title":"FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2506.09638","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09638","snapshot_observed_at":"2026-07-02T12:46:56.783735Z","title":"org/abs/2506.09638","venue":null,"work_id":"c6ae6167-ceb4-4fba-b89a-108993b54da8","year":2025},"citing_paper":{"arxiv_id":"2606.05736","last_updated":"2026-06-04T05:55:15Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T05:55:15Z","title":"VTI-CoT: Visual-Textual Interleaved Chain of Thought for Video Reasoning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-28T01:52:44.785582Z"},"links":{"cited_paper":"/paper/2506.09638","citing_paper":"/paper/2606.05736"},"observation_digest":"sha256:39083dc9e545d1769cc23e56528f842b10350110f68020dfbfb47384f977e37a","observation_id":"3c225ccd-48af-43ea-8c35-869ac0184beb","resolution":{"observed_at":"2026-07-02T12:46:56.785169Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.09638/citation-record","integrity":"/paper/2506.09638/integrity","json":"/paper/2506.09638/citation-record.json","paper":"/paper/2506.09638"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T04:46:48.684669Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09638","last_updated":"2025-06-11T11:52:27Z","snapshot_observed_at":"2026-08-09T02:22:54.050557Z","submitted_at":"2025-06-11T11:52:27Z","title":"FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:48.684669Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.09638"},"observation_digest":"sha256:1604365c5e8c89e84143749a5d34704072c3136fbb0f2622dbf049ef89ba200b","observation_id":"3687621b-3200-4b01-a764-79c25aeb6402","resolution":{"observed_at":"2026-08-07T04:46:48.684669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:49.411143Z","title":"FedMBridge: Bridgeable multimodal federated learning","venue":null,"work_id":"02a106e1-7d06-4784-bfe7-c426b2fef010","year":2024},"citing_paper":{"arxiv_id":"2506.09638","last_updated":"2025-06-11T11:52:27Z","snapshot_observed_at":"2026-08-09T02:22:54.050557Z","submitted_at":"2025-06-11T11:52:27Z","title":"FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:48.689138Z"},"links":{"citing_paper":"/paper/2506.09638"},"observation_digest":"sha256:6e77e047d695befa60f7c6521c3aa9f9d387f216c625621ab5945aa24c102a64","observation_id":"4286ba1d-0d28-4e5d-b288-a4e2601deb45","resolution":{"observed_at":"2026-08-07T04:46:49.415097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:48.693076Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.09638","last_updated":"2025-06-11T11:52:27Z","snapshot_observed_at":"2026-08-09T02:22:54.050557Z","submitted_at":"2025-06-11T11:52:27Z","title":"FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:48.693076Z"},"links":{"citing_paper":"/paper/2506.09638"},"observation_digest":"sha256:ce1ffc4f8eb7e78fd6e1243ae4dff7666733a862d61f2978e4f9286ebd2fbb88","observation_id":"7276e55d-b06b-4886-bccd-984f9872456f","resolution":{"observed_at":"2026-08-07T04:46:48.693076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:49.391772Z","title":"Personalized federated learning with theoretical guarantees: A model-agnostic meta-learning approach","venue":null,"work_id":"5bbaf854-dd3c-4c3e-a820-1761af44f387","year":2020},"citing_paper":{"arxiv_id":"2506.09638","last_updated":"2025-06-11T11:52:27Z","snapshot_observed_at":"2026-08-09T02:22:54.050557Z","submitted_at":"2025-06-11T11:52:27Z","title":"FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:48.697510Z"},"links":{"citing_paper":"/paper/2506.09638"},"observation_digest":"sha256:a8eb50082db0078a6a86dc875fa15b306fda744540645ffd5b779d17d9aa2653","observation_id":"daaea0cb-42f9-4519-86e3-fcb340cf2af3","resolution":{"observed_at":"2026-08-07T04:46:49.395750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.15010","last_updated":"2023-04-28T17:59:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-28T17:59:25Z","title":"LLaMA-Adapter V2: Parameter-Efficient Visual Instruction Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.15010","snapshot_observed_at":"2026-08-07T04:46:48.702039Z","title":"Llama-adapter v2: Parameter-efficient visual instruction model.arXiv preprint arXiv:2304.15010, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09638","last_updated":"2025-06-11T11:52:27Z","snapshot_observed_at":"2026-08-09T02:22:54.050557Z","submitted_at":"2025-06-11T11:52:27Z","title":"FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:48.702039Z"},"links":{"cited_paper":"/paper/2304.15010","citing_paper":"/paper/2506.09638"},"observation_digest":"sha256:b5248d988bf9e16861b1bc844ffd343e23a5cf1615e0451849ce56df499c8511","observation_id":"558d49a0-913a-4979-ac04-943d7524c967","resolution":{"observed_at":"2026-08-07T04:46:48.702039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.11514","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:49.007821Z","title":"Exploring the vulnerabilities of federated learning: A deep dive into gradient inversion attacks.arXiv preprint arXiv:2503.11514, 2025","venue":null,"work_id":"1c39d18d-5e62-4e50-874a-7d0c8b4878a7","year":2025},"citing_paper":{"arxiv_id":"2506.09638","last_updated":"2025-06-11T11:52:27Z","snapshot_observed_at":"2026-08-09T02:22:54.050557Z","submitted_at":"2025-06-11T11:52:27Z","title":"FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:48.706200Z"},"links":{"citing_paper":"/paper/2506.09638"},"observation_digest":"sha256:70cf51a5990f401670dee2f0ea61b776968e95f33ac9d54f729a6db0d75abe4e","observation_id":"05525e87-928d-4b40-92be-854987948b73","resolution":{"observed_at":"2026-08-07T04:46:49.015685Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:49.379774Z","title":"A new federated learning framework against gradient inversion attacks","venue":null,"work_id":"6c9db9e2-5783-47f5-b4ee-fc6643b5ca9f","year":2025},"citing_paper":{"arxiv_id":"2506.09638","last_updated":"2025-06-11T11:52:27Z","snapshot_observed_at":"2026-08-09T02:22:54.050557Z","submitted_at":"2025-06-11T11:52:27Z","title":"FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:48.710442Z"},"links":{"citing_paper":"/paper/2506.09638"},"observation_digest":"sha256:a07a9e76e3e86b60b26242d7cb3bade9dc5ea640f57793f8c2b9d3a28c348693","observation_id":"d94aa90f-a676-4eec-a61a-a57d319429b8","resolution":{"observed_at":"2026-08-07T04:46:49.383880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:49.367781Z","title":"Selective aggregation for low-rank adaptation in federated learning","venue":null,"work_id":"b4d47d67-1c7e-472f-8b37-db8b49288b6c","year":2025},"citing_paper":{"arxiv_id":"2506.09638","last_updated":"2025-06-11T11:52:27Z","snapshot_observed_at":"2026-08-09T02:22:54.050557Z","submitted_at":"2025-06-11T11:52:27Z","title":"FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:48.714311Z"},"links":{"citing_paper":"/paper/2506.09638"},"observation_digest":"sha256:07c65a01cdf8626144e8c83fb6f9ef007c8b1e713eb23a993e070f04bb56a4fd","observation_id":"f88e9a82-ec7d-48d9-8f4b-8e7ce4bff44d","resolution":{"observed_at":"2026-08-07T04:46:49.371984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:49.355806Z","title":"Measuring the effects of non-identical data distribu- tion for federated visual classification, 2019","venue":null,"work_id":"d85a7dc9-f972-4703-af90-a5cf7bd89e38","year":2019},"citing_paper":{"arxiv_id":"2506.09638","last_updated":"2025-06-11T11:52:27Z","snapshot_observed_at":"2026-08-09T02:22:54.050557Z","submitted_at":"2025-06-11T11:52:27Z","title":"FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:48.718522Z"},"links":{"citing_paper":"/paper/2506.09638"},"observation_digest":"sha256:97b96140ed3c11a58346ea231331430183c29a30824b37c32ec58b8ee11fe7ee","observation_id":"d8e72b90-424c-4784-8947-f491ce13cc48","resolution":{"observed_at":"2026-08-07T04:46:49.359782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:48.722162Z","title":"Lora: Low-rank adaptation of large language models.ICLR, 1(2):3, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.09638","last_updated":"2025-06-11T11:52:27Z","snapshot_observed_at":"2026-08-09T02:22:54.050557Z","submitted_at":"2025-06-11T11:52:27Z","title":"FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:48.722162Z"},"links":{"citing_paper":"/paper/2506.09638"},"observation_digest":"sha256:26c0f2db8691942ed581c2ebfd83ebe26be1804664f64326bde8906801f86714","observation_id":"14599aa7-b0d8-48e4-8a62-08b9b0d14aed","resolution":{"observed_at":"2026-08-07T04:46:48.722162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:49.336393Z","title":"Fedlps: Heterogeneous federated learning for multiple tasks with local parameter sharing, 2024","venue":null,"work_id":"4e823934-290d-4441-943a-856daaee061e","year":2024},"citing_paper":{"arxiv_id":"2506.09638","last_updated":"2025-06-11T11:52:27Z","snapshot_observed_at":"2026-08-09T02:22:54.050557Z","submitted_at":"2025-06-11T11:52:27Z","title":"FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:48.726332Z"},"links":{"citing_paper":"/paper/2506.09638"},"observation_digest":"sha256:9c81d875eaea2df412ba5fcfbc7dc6b3012f9edf4ecf5d13e4b2eb7051c72315","observation_id":"1cbae2c3-cedd-4128-afa3-4f4bfcbe2b30","resolution":{"observed_at":"2026-08-07T04:46:49.340328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:49.324717Z","title":null,"venue":null,"work_id":"2af10347-639e-440f-bd3b-235b10d8a5f4","year":2019},"citing_paper":{"arxiv_id":"2506.09638","last_updated":"2025-06-11T11:52:27Z","snapshot_observed_at":"2026-08-09T02:22:54.050557Z","submitted_at":"2025-06-11T11:52:27Z","title":"FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:48.730944Z"},"links":{"citing_paper":"/paper/2506.09638"},"observation_digest":"sha256:8f769f93a1645df69f98eba46a38dfa9c7800e2cf24b31cd0f532de382980606","observation_id":"ff54f841-c76d-44c9-92e9-604b57fc5664","resolution":{"observed_at":"2026-08-07T04:46:49.328507Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:49.312474Z","title":"ReferItGame: Referring to objects in photographs of natural scenes","venue":null,"work_id":"9d97ef9d-5195-49ac-aeae-e0aed9ee24c4","year":2014},"citing_paper":{"arxiv_id":"2506.09638","last_updated":"2025-06-11T11:52:27Z","snapshot_observed_at":"2026-08-09T02:22:54.050557Z","submitted_at":"2025-06-11T11:52:27Z","title":"FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:48.735198Z"},"links":{"citing_paper":"/paper/2506.09638"},"observation_digest":"sha256:2b6fe7709c2fec7d2583421e492751a61ff95bc74da236a4847442ecd0ca35e1","observation_id":"fc7cd118-c8a0-42c2-941a-9ff54a03501a","resolution":{"observed_at":"2026-08-07T04:46:49.316564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:49.300454Z","title":"Federatedscope-llm: A comprehensive package for fine-tuning large language models in federated learning","venue":null,"work_id":"b040a6d7-412d-4af7-8cf9-c51fc8eced10","year":2024},"citing_paper":{"arxiv_id":"2506.09638","last_updated":"2025-06-11T11:52:27Z","snapshot_observed_at":"2026-08-09T02:22:54.050557Z","submitted_at":"2025-06-11T11:52:27Z","title":"FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:48.738823Z"},"links":{"citing_paper":"/paper/2506.09638"},"observation_digest":"sha256:ee862f18449b9cf09e55e9efbb713cb1f80ba84a281fcee24aa84860502a19de","observation_id":"61969c35-083c-417d-a109-145ccb1ae660","resolution":{"observed_at":"2026-08-07T04:46:49.304569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:48.742288Z","title":"A dataset of clinically generated visual questions and answers about radiology images.Scientific data, 5(1):1–10, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.09638","last_updated":"2025-06-11T11:52:27Z","snapshot_observed_at":"2026-08-09T02:22:54.050557Z","submitted_at":"2025-06-11T11:52:27Z","title":"FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:48.742288Z"},"links":{"citing_paper":"/paper/2506.09638"},"observation_digest":"sha256:e43b83978041f98393a37f8f1c786bc6d454ff6c76a168d88a98f007158b272b","observation_id":"0d7733ea-24b1-4bcf-9f02-f63c684f800c","resolution":{"observed_at":"2026-08-07T04:46:48.742288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:49.281093Z","title":"Federated optimization in heterogeneous networks, 2020","venue":null,"work_id":"ba60e5d9-2d84-4091-a17a-7c2cdfa16a71","year":2020},"citing_paper":{"arxiv_id":"2506.09638","last_updated":"2025-06-11T11:52:27Z","snapshot_observed_at":"2026-08-09T02:22:54.050557Z","submitted_at":"2025-06-11T11:52:27Z","title":"FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:48.745943Z"},"links":{"citing_paper":"/paper/2506.09638"},"observation_digest":"sha256:8e4e6da412104d4e53e7f626c40506377355e4784933b4c06b5b534d7b11ddf4","observation_id":"ed4a0e06-c688-453d-92da-1ed6e81bc56d","resolution":{"observed_at":"2026-08-07T04:46:49.285106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02503","last_updated":"2024-08-05T14:27:39Z","snapshot_observed_at":"2026-08-11T02:46:50.663224Z","submitted_at":"2024-08-05T14:27:39Z","title":"UnifiedMLLM: Enabling Unified Representation for Multi-modal Multi-tasks With Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02503","snapshot_observed_at":"2026-08-07T04:46:48.750294Z","title":"Unifiedmllm: Enabling unified representation for multi-modal multi-tasks with large language model.arXiv preprint arXiv:2408.02503, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09638","last_updated":"2025-06-11T11:52:27Z","snapshot_observed_at":"2026-08-09T02:22:54.050557Z","submitted_at":"2025-06-11T11:52:27Z","title":"FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:48.750294Z"},"links":{"cited_paper":"/paper/2408.02503","citing_paper":"/paper/2506.09638"},"observation_digest":"sha256:91203baa732b9c3d176abcf7b6f9f1195fef5bef8152e0af68efaa189b975e33","observation_id":"c80410a0-366b-4f71-990b-2e05fc27441e","resolution":{"observed_at":"2026-08-07T04:46:48.750294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:48.755470Z","title":"Lawrence Zitnick, and Piotr Dollár","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.09638","last_updated":"2025-06-11T11:52:27Z","snapshot_observed_at":"2026-08-09T02:22:54.050557Z","submitted_at":"2025-06-11T11:52:27Z","title":"FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:48.755470Z"},"links":{"citing_paper":"/paper/2506.09638"},"observation_digest":"sha256:67b1da34b64fb32c3c6eb520ea5d4822f70566341cf063e6097817c5084519b4","observation_id":"6fcec27f-9c28-4ef9-95eb-ace020d99d1d","resolution":{"observed_at":"2026-08-07T04:46:48.755470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:49.261121Z","title":"Slake: A semantically-labeled knowledge-enhanced dataset for medical visual question answering, 2021","venue":null,"work_id":"1e59fd81-b47f-4f26-8354-0555c44a4b77","year":2021},"citing_paper":{"arxiv_id":"2506.09638","last_updated":"2025-06-11T11:52:27Z","snapshot_observed_at":"2026-08-09T02:22:54.050557Z","submitted_at":"2025-06-11T11:52:27Z","title":"FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:48.759466Z"},"links":{"citing_paper":"/paper/2506.09638"},"observation_digest":"sha256:721af39538ca0d9694568c14fc373d71bddfc83e62669398509788417f878a2e","observation_id":"17c332f1-4dad-48bd-8985-39e940a0f4fa","resolution":{"observed_at":"2026-08-07T04:46:49.265909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:49.249011Z","title":"Visual instruction tuning.NIPS, 36:34892– 34916, 2023","venue":null,"work_id":"2a1ffb9d-5171-4527-b903-15817b65bd01","year":2023},"citing_paper":{"arxiv_id":"2506.09638","last_updated":"2025-06-11T11:52:27Z","snapshot_observed_at":"2026-08-09T02:22:54.050557Z","submitted_at":"2025-06-11T11:52:27Z","title":"FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:48.763946Z"},"links":{"citing_paper":"/paper/2506.09638"},"observation_digest":"sha256:996c2897308fc4b6d5bc85d5373465b62d1ef1a24e37f57cbb1ee668fce123ab","observation_id":"8573775a-0fbf-48d7-a371-401010216341","resolution":{"observed_at":"2026-08-07T04:46:49.253255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:48.767754Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.09638","last_updated":"2025-06-11T11:52:27Z","snapshot_observed_at":"2026-08-09T02:22:54.050557Z","submitted_at":"2025-06-11T11:52:27Z","title":"FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:48.767754Z"},"links":{"citing_paper":"/paper/2506.09638"},"observation_digest":"sha256:59a901531857b0acba0e676c363c58b3ad601d844f94f7e03f330600658e7a40","observation_id":"c7be9ac6-7605-470e-874b-3dbd90e7733d","resolution":{"observed_at":"2026-08-07T04:46:48.767754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:49.228537Z","title":"Fine-grained visual classification of aircraft, 2013","venue":null,"work_id":"e9390e61-9351-493b-8fb1-d920402923bc","year":2013},"citing_paper":{"arxiv_id":"2506.09638","last_updated":"2025-06-11T11:52:27Z","snapshot_observed_at":"2026-08-09T02:22:54.050557Z","submitted_at":"2025-06-11T11:52:27Z","title":"FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:48.771667Z"},"links":{"citing_paper":"/paper/2506.09638"},"observation_digest":"sha256:a2a24566a14bc040b44b0745fa8b93d818ecb78507223e86c40b4092f6aa92e2","observation_id":"9eed584a-cd20-4b2e-b846-be141e2870c4","resolution":{"observed_at":"2026-08-07T04:46:49.232649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:49.215731Z","title":"Brendan McMahan, Eider Moore, Daniel Ramage, Seth Hampson, and Blaise Agüera y Arcas","venue":null,"work_id":"917c6d81-e6f1-4a37-a4ac-c9af8f46d28a","year":2023},"citing_paper":{"arxiv_id":"2506.09638","last_updated":"2025-06-11T11:52:27Z","snapshot_observed_at":"2026-08-09T02:22:54.050557Z","submitted_at":"2025-06-11T11:52:27Z","title":"FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:48.776135Z"},"links":{"citing_paper":"/paper/2506.09638"},"observation_digest":"sha256:ee7c0da6976c62beb045bef9185ae8aa3d4d1656c959a9de1c3c5acd8e3172b3","observation_id":"5d58df5e-ae06-44c5-a59a-cf82b6fd8b79","resolution":{"observed_at":"2026-08-07T04:46:49.220202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:49.203470Z","title":"Introducing meta llama 3: The most capable openly available llm to date.Meta AI, 2024","venue":null,"work_id":"d7fce23f-9586-47c0-a3e3-7bec221e59fc","year":2024},"citing_paper":{"arxiv_id":"2506.09638","last_updated":"2025-06-11T11:52:27Z","snapshot_observed_at":"2026-08-09T02:22:54.050557Z","submitted_at":"2025-06-11T11:52:27Z","title":"FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:48.779836Z"},"links":{"citing_paper":"/paper/2506.09638"},"observation_digest":"sha256:293a40256add753cda1104c13cea04955e625c6d3e2907442d07ac99e195159f","observation_id":"421bfc29-05b1-4f7e-8f40-9dda2603b39b","resolution":{"observed_at":"2026-08-07T04:46:49.207534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:48.783497Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.09638","last_updated":"2025-06-11T11:52:27Z","snapshot_observed_at":"2026-08-09T02:22:54.050557Z","submitted_at":"2025-06-11T11:52:27Z","title":"FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:48.783497Z"},"links":{"citing_paper":"/paper/2506.09638"},"observation_digest":"sha256:01c47bd7c1aec5096e1004f6126b31fbfca4c3a324b9b25657aeeab2fe94a3b2","observation_id":"5c311a02-a6b8-41c6-a168-db30a83f2495","resolution":{"observed_at":"2026-08-07T04:46:48.783497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:48.786814Z","title":"Learning transferable visual models from natural language supervision, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.09638","last_updated":"2025-06-11T11:52:27Z","snapshot_observed_at":"2026-08-09T02:22:54.050557Z","submitted_at":"2025-06-11T11:52:27Z","title":"FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:48.786814Z"},"links":{"citing_paper":"/paper/2506.09638"},"observation_digest":"sha256:e758febec7daa573c6714a9c54bf0f99983a9ad8a4f8968e80046f190a6fae35","observation_id":"5e48f7c5-2761-48e0-83c0-9592e2ac0fd5","resolution":{"observed_at":"2026-08-07T04:46:48.786814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.00295","last_updated":"2021-09-08T23:37:17Z","snapshot_observed_at":"2026-07-06T09:01:12.515300Z","submitted_at":"2020-02-29T16:37:29Z","title":"Adaptive Federated Optimization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.00295","snapshot_observed_at":"2026-08-07T04:46:48.790571Z","title":"Adaptive federated optimization.arXiv preprint arXiv:2003.00295, 2020","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2506.09638","last_updated":"2025-06-11T11:52:27Z","snapshot_observed_at":"2026-08-09T02:22:54.050557Z","submitted_at":"2025-06-11T11:52:27Z","title":"FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:48.790571Z"},"links":{"cited_paper":"/paper/2003.00295","citing_paper":"/paper/2506.09638"},"observation_digest":"sha256:2da96ccd2e808c72c699753c0a544d29a3a32fc5022334968b5b0fea133f6101","observation_id":"0e0f3a57-d0fa-4ca9-aa7f-93a902cdf445","resolution":{"observed_at":"2026-08-07T04:46:48.790571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:49.176980Z","title":"Brendan McMahan","venue":null,"work_id":"a712238a-cc0a-4b9a-92cf-7ed372149816","year":2021},"citing_paper":{"arxiv_id":"2506.09638","last_updated":"2025-06-11T11:52:27Z","snapshot_observed_at":"2026-08-09T02:22:54.050557Z","submitted_at":"2025-06-11T11:52:27Z","title":"FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:48.794830Z"},"links":{"citing_paper":"/paper/2506.09638"},"observation_digest":"sha256:eddaa1c26b3247fd77ea04e6191c23534b13bfea723dd82a5489f74295f95b61","observation_id":"9b994af4-a485-42c3-b943-df7836a4951a","resolution":{"observed_at":"2026-08-07T04:46:49.180748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:49.165116Z","title":"Exploring models and data for image question answering, 2015","venue":null,"work_id":"cb0fb57e-cd21-4851-b021-2894a6335fac","year":2015},"citing_paper":{"arxiv_id":"2506.09638","last_updated":"2025-06-11T11:52:27Z","snapshot_observed_at":"2026-08-09T02:22:54.050557Z","submitted_at":"2025-06-11T11:52:27Z","title":"FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:48.798543Z"},"links":{"citing_paper":"/paper/2506.09638"},"observation_digest":"sha256:19175924adeff664b704806aa76d7dcefe131a2d860efb0ce86bd806c2b6008d","observation_id":"cc5a492a-fd7d-48c7-80f0-a155200d9c34","resolution":{"observed_at":"2026-08-07T04:46:49.169097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:48.802233Z","title":"Chameleon: Mixed-modal early-fusion foundation models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09638","last_updated":"2025-06-11T11:52:27Z","snapshot_observed_at":"2026-08-09T02:22:54.050557Z","submitted_at":"2025-06-11T11:52:27Z","title":"FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:48.802233Z"},"links":{"citing_paper":"/paper/2506.09638"},"observation_digest":"sha256:c32f5dbc43e23fb52900349f8b1c2d5ba10324703ecec8edf5e166849148d89a","observation_id":"14ed9eac-a4d4-4169-a983-148c59da03fe","resolution":{"observed_at":"2026-08-07T04:46:48.802233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T04:46:48.806923Z","title":"Gemini: a family of highly capable multimodal models.arXiv preprint arXiv:2312.11805, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09638","last_updated":"2025-06-11T11:52:27Z","snapshot_observed_at":"2026-08-09T02:22:54.050557Z","submitted_at":"2025-06-11T11:52:27Z","title":"FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:48.806923Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.09638"},"observation_digest":"sha256:008ab86773cd361b8e122fe9fde26618128c123c79afc87d38cfddb8636e3177","observation_id":"d3bc5996-47ec-47d4-a1f5-772b0e7cd7bb","resolution":{"observed_at":"2026-08-07T04:46:48.806923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-07T04:46:48.811789Z","title":"Show-o: One single transformer to unify multimodal understanding and generation.arXiv preprint arXiv:2408.12528, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09638","last_updated":"2025-06-11T11:52:27Z","snapshot_observed_at":"2026-08-09T02:22:54.050557Z","submitted_at":"2025-06-11T11:52:27Z","title":"FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:48.811789Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2506.09638"},"observation_digest":"sha256:2a024c50b55eae353ad171b158f6fb0d93e443d81f45acf9d7166c6753e002a3","observation_id":"792201df-4f85-426e-9a7c-2f85b01f18a4","resolution":{"observed_at":"2026-08-07T04:46:48.811789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:49.145577Z","title":"Pilot: Building the federated multimodal instruction tuning framework, 2025","venue":null,"work_id":"4383799e-c50b-4cf2-96cf-16402ee58aac","year":2025},"citing_paper":{"arxiv_id":"2506.09638","last_updated":"2025-06-11T11:52:27Z","snapshot_observed_at":"2026-08-09T02:22:54.050557Z","submitted_at":"2025-06-11T11:52:27Z","title":"FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:48.816565Z"},"links":{"citing_paper":"/paper/2506.09638"},"observation_digest":"sha256:73a319e6f010f7607ef5bc8969ef102bfb109c2b6519cf1f92c91041eeb94d04","observation_id":"41629199-3860-4d2d-9823-a4069c3ca8fe","resolution":{"observed_at":"2026-08-07T04:46:49.149443Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14717","last_updated":"2025-03-08T13:10:57Z","snapshot_observed_at":"2026-07-06T19:54:09.469212Z","submitted_at":"2024-11-22T04:09:23Z","title":"FedMLLM: Federated Fine-tuning MLLM on Multimodal Heterogeneity Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14717","snapshot_observed_at":"2026-08-07T04:46:48.820248Z","title":"Fedmllm: Federated fine-tuning mllm on multimodal heterogeneity data.arXiv preprint arXiv:2411.14717, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09638","last_updated":"2025-06-11T11:52:27Z","snapshot_observed_at":"2026-08-09T02:22:54.050557Z","submitted_at":"2025-06-11T11:52:27Z","title":"FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:48.820248Z"},"links":{"cited_paper":"/paper/2411.14717","citing_paper":"/paper/2506.09638"},"observation_digest":"sha256:006173cdbe526f40fbc8d1d934166d3369afa53e22c1e07c461f7821f825f4f9","observation_id":"0a106ab8-970c-4955-9bf5-39ff41f19d14","resolution":{"observed_at":"2026-08-07T04:46:48.820248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:49.133815Z","title":"Fedmllm: Federated fine-tuning mllm on multimodal heterogeneity data, 2025","venue":null,"work_id":"a7991a94-3743-46b5-8dd1-15efcb7bb39c","year":2025},"citing_paper":{"arxiv_id":"2506.09638","last_updated":"2025-06-11T11:52:27Z","snapshot_observed_at":"2026-08-09T02:22:54.050557Z","submitted_at":"2025-06-11T11:52:27Z","title":"FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:48.824111Z"},"links":{"citing_paper":"/paper/2506.09638"},"observation_digest":"sha256:f07d9930966b85ab73091916fa7c31eda6b4cf48f74c6a131d77332bcb807670","observation_id":"d98c9006-6fc1-4a8b-bf91-728615edf7a6","resolution":{"observed_at":"2026-08-07T04:46:49.137896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:49.122118Z","title":"Fedllm- bench: Realistic benchmarks for federated learning of large language models.NIPS, 37:111106–111130, 2024","venue":null,"work_id":"c47e2d4d-db90-4dff-b527-b9e2a500e6f5","year":2024},"citing_paper":{"arxiv_id":"2506.09638","last_updated":"2025-06-11T11:52:27Z","snapshot_observed_at":"2026-08-09T02:22:54.050557Z","submitted_at":"2025-06-11T11:52:27Z","title":"FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:48.827827Z"},"links":{"citing_paper":"/paper/2506.09638"},"observation_digest":"sha256:a5034428cf101d4f347eea2f1919acce3aafa0626af40e74f2235b5199cea4b4","observation_id":"a9ac6d2c-1951-4bd6-b05f-5f200bbddce6","resolution":{"observed_at":"2026-08-07T04:46:49.126081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:49.109289Z","title":"Openfedllm: Training large language models on decentralized private data via federated learning","venue":null,"work_id":"65353f97-3071-4cbf-bd42-2de8aeed12ba","year":2024},"citing_paper":{"arxiv_id":"2506.09638","last_updated":"2025-06-11T11:52:27Z","snapshot_observed_at":"2026-08-09T02:22:54.050557Z","submitted_at":"2025-06-11T11:52:27Z","title":"FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:48.831723Z"},"links":{"citing_paper":"/paper/2506.09638"},"observation_digest":"sha256:3b6e57c46fe6125f882a069140353c9e50e5c70973d524e8fe982931443fe75d","observation_id":"ebc7a116-8e1c-4e09-a4f3-768290500b7f","resolution":{"observed_at":"2026-08-07T04:46:49.113860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:49.096448Z","title":"Tackling data heterogeneity in federated learning via loss decomposition","venue":null,"work_id":"6c56842e-c191-4f7f-9e5c-7c6edcdeacb2","year":2024},"citing_paper":{"arxiv_id":"2506.09638","last_updated":"2025-06-11T11:52:27Z","snapshot_observed_at":"2026-08-09T02:22:54.050557Z","submitted_at":"2025-06-11T11:52:27Z","title":"FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:48.835568Z"},"links":{"citing_paper":"/paper/2506.09638"},"observation_digest":"sha256:ec60428340d63b65549798a3331613470772e3dbbed9d3f948fe78df8701b84d","observation_id":"749aa389-b6ff-402c-9da6-e0a7d5239e37","resolution":{"observed_at":"2026-08-07T04:46:49.100515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:49.084261Z","title":"Fedtgp: Trainable global prototypes with adaptive- margin-enhanced contrastive learning for data and model heterogeneity in federated learning, 2024","venue":null,"work_id":"c47776f1-01b7-401e-be46-f9d334c47c97","year":2024},"citing_paper":{"arxiv_id":"2506.09638","last_updated":"2025-06-11T11:52:27Z","snapshot_observed_at":"2026-08-09T02:22:54.050557Z","submitted_at":"2025-06-11T11:52:27Z","title":"FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:48.839218Z"},"links":{"citing_paper":"/paper/2506.09638"},"observation_digest":"sha256:6bd4953c13e79c35a42f1b799597d1c7d99635fdec5bc154f85ac2dfea3be889","observation_id":"b18696cc-86a5-4604-a243-908a3b9b6f80","resolution":{"observed_at":"2026-08-07T04:46:49.088407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:49.072391Z","title":"Mllm- llava-fl: Multimodal large language model assisted federated learning","venue":null,"work_id":"68625701-1034-4919-b3d1-eb48a0db065e","year":2025},"citing_paper":{"arxiv_id":"2506.09638","last_updated":"2025-06-11T11:52:27Z","snapshot_observed_at":"2026-08-09T02:22:54.050557Z","submitted_at":"2025-06-11T11:52:27Z","title":"FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:48.843309Z"},"links":{"citing_paper":"/paper/2506.09638"},"observation_digest":"sha256:284995f3cecb6a22fa5832c9eebee93500bced2fee137497f3d3aec3d2414f2f","observation_id":"16c968b5-ec23-4c8c-b4b1-e3af78ab5aa6","resolution":{"observed_at":"2026-08-07T04:46:49.076280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:49.060264Z","title":"Flhetbench: Benchmarking device and state heterogeneity in federated learning","venue":null,"work_id":"eda3df8a-2a59-480b-96ff-3a0f24f5bf36","year":2024},"citing_paper":{"arxiv_id":"2506.09638","last_updated":"2025-06-11T11:52:27Z","snapshot_observed_at":"2026-08-09T02:22:54.050557Z","submitted_at":"2025-06-11T11:52:27Z","title":"FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:48.847188Z"},"links":{"citing_paper":"/paper/2506.09638"},"observation_digest":"sha256:d30d867324aa09dec2b6c2e7bd5123d1e9b06eb4d69655928b7119d73f8f61ea","observation_id":"b009af85-f999-4183-9a24-7a0db4f64bf3","resolution":{"observed_at":"2026-08-07T04:46:49.064475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:49.048124Z","title":"Radgenome-chest ct: A grounded vision-language dataset for chest ct analysis, 2024","venue":null,"work_id":"52d2c94d-536d-48a9-9314-4716c58d75aa","year":2024},"citing_paper":{"arxiv_id":"2506.09638","last_updated":"2025-06-11T11:52:27Z","snapshot_observed_at":"2026-08-09T02:22:54.050557Z","submitted_at":"2025-06-11T11:52:27Z","title":"FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:48.850831Z"},"links":{"citing_paper":"/paper/2506.09638"},"observation_digest":"sha256:4b36fdf064f2fd5d9d437081f5c6b82b25151c227fcccf32cf15f3aeffb4d24c","observation_id":"c817fdf1-1cc3-47c7-80e7-c8b83804fafe","resolution":{"observed_at":"2026-08-07T04:46:49.052242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.09638","last_updated":"2025-06-11T11:52:27Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T02:22:54.050557Z","submitted_at":"2025-06-11T11:52:27Z","title":"FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":1,"verified_fuzzy":25},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 1 inbound Pith citation observation for arXiv:2506.09638."}