{"as_of":"2026-08-10T09:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7a1f22ae8eb80bb3357bb353adc2f683535d830ef35f6654993b03de5ce26d67","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T10:21:21.500180Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.00260/citation-record","integrity":"/paper/2508.00260/integrity","json":"/paper/2508.00260/citation-record.json","paper":"/paper/2508.00260"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T10:21:21.310768Z","title":"GPT-4 technical report.arXiv preprint arXiv:2303.08774,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.310768Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:02fdef488e87c9e6974c8a87072e7ae1f403eca897beb2a2fcfaffb8507663a3","observation_id":"a2cd95b2-bd47-4f87-863c-e5546ad593d3","resolution":{"observed_at":"2026-08-06T10:21:21.310768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:21:22.063497Z","title":"Expert gate: Lifelong learning with a network of experts","venue":null,"work_id":"5b7b4981-8608-41e9-bd1c-7b15ac93a21b","year":2017},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.315076Z"},"links":{"citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:c427c48ca55dcf836e89687923fcb9f3e8c8f0a12a5ee66ac1720d7f9d74c3b1","observation_id":"8c6088e5-da7c-4619-bf4c-78bc5c5ff8be","resolution":{"observed_at":"2026-08-06T10:21:22.067100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:21:22.054214Z","title":"Memory aware synapses: Learning what (not) to forget","venue":null,"work_id":"825a5d61-6a4a-4b09-89fc-eec44e252071","year":2018},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.318768Z"},"links":{"citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:45f0e27b5ec92fce43b06caf99e2221c749f0f9dde7c6c675ad86b0457cfc657","observation_id":"99ba7021-4be1-4c8b-ab97-3ef594dff23e","resolution":{"observed_at":"2026-08-06T10:21:22.057628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:21:22.044025Z","title":"Generative multi-modal models are good class incremental learners","venue":null,"work_id":"e8750f43-f85b-4158-9eca-c817aee27d51","year":2024},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.322689Z"},"links":{"citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:3acc83e3a9efa83154b40f3e600a0ff0a9ae133e93cfbffa41eb5f5eaa7992ce","observation_id":"f62ad9ad-b7c2-4400-94b4-e6169e020360","resolution":{"observed_at":"2026-08-06T10:21:22.047700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:21:22.033964Z","title":"Honeybee: Locality-enhanced projector for multimodal llm","venue":null,"work_id":"41bd7ce3-4372-4143-ac91-28c3130b75aa","year":2024},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.326048Z"},"links":{"citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:f101273dbde55ce6cc2e3a2d55604f38ba22f70b77fb8c9136eff306f1e3827c","observation_id":"8e8e1114-3b47-4343-a4fc-008ddfec2dd0","resolution":{"observed_at":"2026-08-06T10:21:22.037476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:21:22.023916Z","title":"Riemannian walk for incremen- tal learning: Understanding forgetting and intransigence","venue":null,"work_id":"f8e6bbf0-5a2f-4fb4-890a-1d90fde60da6","year":2018},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.329716Z"},"links":{"citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:0f0eac78e773ed0d664b6e6cb585107ad95970f7928c5247e1282f780bfcd74a","observation_id":"570d82c6-cebe-42ef-a1e6-21476761a094","resolution":{"observed_at":"2026-08-06T10:21:22.027727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:21:22.014010Z","title":"CoIN: A benchmark of continual instruction tuning for multimodel large language models","venue":null,"work_id":"b4d5dd45-c661-467c-b4be-aa3d3398e523","year":2025},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.333291Z"},"links":{"citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:3800956d04bf03fd7da579a6819e7e20fcf43d130b49eec204cec2b3037b858b","observation_id":"30788f19-cb92-480b-8fbd-a5ac6691d02f","resolution":{"observed_at":"2026-08-06T10:21:22.017546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:21:22.003910Z","title":"Lifelong language pretraining with distribution-specialized experts","venue":null,"work_id":"11042c59-abeb-4f44-b9d7-7c4bf63ed1db","year":2023},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.336761Z"},"links":{"citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:df6b8f849d6712581fc6d5de82655969670d811355c87c8cf04fa78c6a8eecb5","observation_id":"dd7b02c6-1581-4797-8a2c-1351ec226a56","resolution":{"observed_at":"2026-08-06T10:21:22.007441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:21:21.993997Z","title":"Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality, march 2023.URL https://lmsys","venue":null,"work_id":"d2fbee2d-2d08-42ec-a87a-67b3127a48b5","year":2023},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.340156Z"},"links":{"citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:42c0305db21d423607158a6beeab9d6c42f29bd80db3db2b2d5b00c9ab036420","observation_id":"81a25914-8eaa-4039-a0dc-17fafc13e101","resolution":{"observed_at":"2026-08-06T10:21:21.997478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:21:21.983439Z","title":"V ocabulary-free image classification.Advances in Neural Information Processing Systems, 36:30662–30680, 2023","venue":null,"work_id":"942ac048-1cf1-4d86-8579-eea21a3cf59a","year":2023},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.343385Z"},"links":{"citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:2a7cd47bd2a0ccae7dc7784c8538cfe63d7c210c8237c126eaed0722499e178b","observation_id":"945b7b39-0945-4280-a61a-bdaa7a41fb4d","resolution":{"observed_at":"2026-08-06T10:21:21.987564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-08-06T10:21:21.347451Z","title":"Instructblip: To- wards general-purpose vision-language models with instruc- tion tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.347451Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:7a87ee6658079cb5586b91012cdf4a75c9fafb9c23cfce163991b10868e6f5ca","observation_id":"2ab47047-23b1-4284-bff6-c519341f81e7","resolution":{"observed_at":"2026-08-06T10:21:21.347451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:21:21.972111Z","title":"RATT: Recurrent attention to transient tasks for continual image captioning.Advances in Neural Information Processing Systems, 33:16736–16748,","venue":null,"work_id":"5303a112-9fa6-42a6-83d9-e60f4a565483","year":null},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.351302Z"},"links":{"citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:4e182b395f442b6ab93d07f341fca50c2811a6143bc7754dc4c77fb52833153d","observation_id":"06a9d7c0-b14e-4747-883b-cdd02f613800","resolution":{"observed_at":"2026-08-06T10:21:21.976443Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:21:21.961459Z","title":"DyTox: Transformers for continual learning with dynamic token expansion","venue":null,"work_id":"d7f7f814-0850-4136-ab3c-a73e19b8088a","year":2022},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.355162Z"},"links":{"citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:769b238a696d2801e9ff2b0e91fe3c021481c0beb29e252c8f96f85b2b2b4b52","observation_id":"a6ea476f-f29f-493b-a247-ed1bf7a12bc6","resolution":{"observed_at":"2026-08-06T10:21:21.965024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:21:21.951051Z","title":"EV A: Exploring the limits of masked visual representa- tion learning at scale","venue":null,"work_id":"e5df3fc1-92f2-4de4-ba55-e6d1f9540a97","year":2023},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.359574Z"},"links":{"citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:d1b0a55aabbcff0e35a7b7095a78a941992e0d1f037fa26b241d454b95a8eb21","observation_id":"45fca5ca-69f9-48be-8db1-23abe7e24f42","resolution":{"observed_at":"2026-08-06T10:21:21.954607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:21:21.941084Z","title":"Beyond prompt learning: Continual adapter for efficient rehearsal-free continual learning","venue":null,"work_id":"9bc84d6f-635e-4fc6-a22e-1171b2e55a18","year":2024},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.363466Z"},"links":{"citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:e6e12fa37649e75367a5fdddbcb5ee5717ee09e99a0fabae285e5803fb4c5550","observation_id":"b22df089-9ead-47e1-a943-6e6380b1d531","resolution":{"observed_at":"2026-08-06T10:21:21.944646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16206","last_updated":"2023-11-27T15:04:48Z","snapshot_observed_at":"2026-08-08T00:39:51.098827Z","submitted_at":"2023-11-27T15:04:48Z","title":"Continual Instruction Tuning for Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16206","snapshot_observed_at":"2026-08-06T10:21:21.366736Z","title":"Continual instruction tuning for large multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.366736Z"},"links":{"cited_paper":"/paper/2311.16206","citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:379b00db7e4513e237485149b84e904a5dc294258c0d19c3199ab038fe6953bb","observation_id":"02372aff-844f-4e71-8370-72ec0917cdeb","resolution":{"observed_at":"2026-08-06T10:21:21.366736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:21:21.930981Z","title":"The many faces of robust- ness: A critical analysis of out-of-distribution generalization","venue":null,"work_id":"0ab6c7cd-555b-4f33-94fc-c1a3d4320aed","year":2021},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.370202Z"},"links":{"citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:e545c0bc43b532b7cf14018195a1f2398d2363382fb4985e0929ad83a9205770","observation_id":"0bee0757-8a2a-4ee7-a506-1be9dca4f475","resolution":{"observed_at":"2026-08-06T10:21:21.934456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:21:21.920774Z","title":"CLIPScore: A reference-free evaluation metric for image captioning","venue":null,"work_id":"a38b69b7-83c3-44d5-b700-cac4e4bad537","year":2021},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.373331Z"},"links":{"citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:7b42d4d553fd46c55ff66c8d2e2421dd4a12a1194dcaf322b707d205c4982447","observation_id":"b20eeacf-6977-4ed0-ad91-0c2f538a8ce3","resolution":{"observed_at":"2026-08-06T10:21:21.924153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-06T10:21:21.376708Z","title":"LoRA: Low-rank adaptation of large language models.arXiv preprint arXiv:2106.09685, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.376708Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:bb65d1c9d65c3f23628d68236d3c27b682effa88565efbd6bbf395c458886b9a","observation_id":"3bdd2268-3957-48f4-88f7-8181ab064744","resolution":{"observed_at":"2026-08-06T10:21:21.376708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:21:21.380456Z","title":"Adaptive mixtures of local experts.Neu- ral computation, 3(1):79–87, 1991","venue":null,"work_id":null,"year":1991},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.380456Z"},"links":{"citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:43b4534577f943514e667676cf37f01821dca77c21f1035b961b480cf9ea0786","observation_id":"5326a5b6-36e1-4a81-92ee-3c77860b2220","resolution":{"observed_at":"2026-08-06T10:21:21.380456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:21:21.904809Z","title":"Vi- sual prompt tuning","venue":null,"work_id":"bed74e92-84ed-49d7-94e4-1defc9c98dbf","year":2022},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.384416Z"},"links":{"citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:a423ea6b5d0215dcce5b737f0c39e7727963fd127492a8c51985ae5e862fce1e","observation_id":"8a380d33-a13b-4e35-94f8-41dbb652a36c","resolution":{"observed_at":"2026-08-06T10:21:21.908229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:21:21.894323Z","title":"Helpful or harmful: Inter- task association in continual learning","venue":null,"work_id":"03e64c8f-cfb5-4c32-9e88-0cc6a8f6315a","year":2022},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.387520Z"},"links":{"citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:700f0f1d52155520bbec6e2cb81abba89ce72fa848e6867425af9f17146c4429","observation_id":"4046f619-d310-4c43-916e-7e154fa85702","resolution":{"observed_at":"2026-08-06T10:21:21.898082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:21:21.884600Z","title":"Growing a brain with sparsity-inducing genera- tion for continual learning","venue":null,"work_id":"0ce3fd53-3a63-4880-9282-df0d9b30ebdd","year":2023},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.391038Z"},"links":{"citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:1dddb928bfd9723134e910f9b7a26c083992234133f18441c9841da5b4ff3adf","observation_id":"c2627989-9973-45ca-8420-7fcadd3372a3","resolution":{"observed_at":"2026-08-06T10:21:21.888147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:21:21.874143Z","title":"Deep visual-semantic align- ments for generating image descriptions","venue":null,"work_id":"71cfd0a6-c3a4-4df1-b207-9f9381bcb8b8","year":2015},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.394628Z"},"links":{"citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:f456815740a1316658ffe5f0a97272944dd502b405837cc11d99007f15b5fca8","observation_id":"263528cf-4529-4fb3-92b3-b84b4b146685","resolution":{"observed_at":"2026-08-06T10:21:21.877582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:21:21.863452Z","title":"Overcoming catastrophic forgetting in neu- ral networks.Proceedings of the National Academy of Sci- ences of the United States of America, 114(13):3521–3526,","venue":null,"work_id":"89f0d6e7-d90e-4e67-bb61-246c7376f6fe","year":null},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.397882Z"},"links":{"citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:81863a4818626780a7eb5ba3988189c202aa47d73e9f927b9bbcf80bafe23fc0","observation_id":"6ad4d4fa-f5d2-4bd1-a32d-e55d25b24242","resolution":{"observed_at":"2026-08-06T10:21:21.867258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.09700","last_updated":"2019-11-04T20:37:33Z","snapshot_observed_at":"2026-07-06T08:31:12.309726Z","submitted_at":"2019-10-21T23:57:32Z","title":"Quantifying the Carbon Emissions of Machine Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.09700","snapshot_observed_at":"2026-08-06T10:21:21.401198Z","title":"Quantifying the carbon emissions of machine learning.arXiv preprint arXiv:1910.09700, 2019","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.401198Z"},"links":{"cited_paper":"/paper/1910.09700","citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:7f53a0da55496038e37c2af4f400eead70586ffeb345f09618803145b0d771d8","observation_id":"2d94a6d3-33dc-493a-b215-ac027f494ba4","resolution":{"observed_at":"2026-08-06T10:21:21.401198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:21:21.852594Z","title":"GShard: Scaling giant models with conditional computation and automatic sharding","venue":null,"work_id":"523d8cc7-f58a-4eb4-aa7e-f71a6710776a","year":null},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.404660Z"},"links":{"citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:c3f8bbffa7b78cfac5ce14abefca39de250676253b8619082c4e3b9e56e85d37","observation_id":"e97382b7-74b5-40ff-9acb-2aa6f612a842","resolution":{"observed_at":"2026-08-06T10:21:21.857066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-06T10:21:21.408225Z","title":"Seed-bench: Benchmarking mul- timodal llms with generative comprehension.arXiv preprint arXiv:2307.16125, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.408225Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:5d05a5e3615e9ccbc75e9d3e99cc9884d9d09d9a12af3e72bfe78406d88cddfb","observation_id":"e1280ef7-e5aa-4e2e-afc9-d1a6581f1682","resolution":{"observed_at":"2026-08-06T10:21:21.408225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:21:21.842337Z","title":"BLIP-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"0784fbce-d282-4089-afbf-d31b711cae67","year":2023},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.411788Z"},"links":{"citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:a4c6a5151123677a5bb2e97721766bd6be75a1a0f327635adc1eed6493f92a8e","observation_id":"ba8b8395-1e75-4d1a-b2e2-4241ffd20f49","resolution":{"observed_at":"2026-08-06T10:21:21.845884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:21:21.832271Z","title":"Learning without forgetting","venue":null,"work_id":"ba59aa12-44e6-43fa-8260-5428c4119120","year":2017},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.414960Z"},"links":{"citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:3b47371609b0db097b1d57c362fbea1adac6a436704ac3555e25975448e7c668","observation_id":"4f8163e8-6e42-49a3-ae1f-3b14c7fd1d8b","resolution":{"observed_at":"2026-08-06T10:21:21.835870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:21:21.821482Z","title":"InfLoRA: Interference-free low-rank adaptation for continual learning","venue":null,"work_id":"efd36634-8d0c-43bc-803d-70609164f375","year":2024},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.418162Z"},"links":{"citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:9e28e4ea3f8dd4a5d01ca5939e74f7f253d8143489f304701b5d4e7e20b2d79e","observation_id":"3ea7bd6f-3ff7-43e2-baac-83a22dff776b","resolution":{"observed_at":"2026-08-06T10:21:21.825621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:21:21.421578Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.421578Z"},"links":{"citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:a7775631a38a25437bdf1732c2dbba07cc79892f1a73e92787c60ee78e39e63d","observation_id":"444189ce-f650-444a-8d50-5e51921f735a","resolution":{"observed_at":"2026-08-06T10:21:21.421578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:21:21.424576Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.424576Z"},"links":{"citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:44560a32ed4e79486691c490b55ce815ed07ed7b5060f9086fd7a3a43ed67d8a","observation_id":"1e4fc8c2-bcee-4400-86e1-ce01a0297c89","resolution":{"observed_at":"2026-08-06T10:21:21.424576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:21:21.798380Z","title":"Adaptive aggregation networks for class-incremental learning","venue":null,"work_id":"d336afa9-617f-4cc2-a186-d1130148e814","year":2021},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.427663Z"},"links":{"citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:705705c5088f10fcf28c515d079d6953810181496d235f5477f27523469915c6","observation_id":"2d6433d5-c150-47ed-b400-6d06c5ff7eab","resolution":{"observed_at":"2026-08-06T10:21:21.802726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:21:21.786934Z","title":"Unified-IO 2: Scaling autoregressive multimodal models with vision language audio and action","venue":null,"work_id":"af21d060-cc8c-42b2-86a9-235bf6300c05","year":2024},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.430584Z"},"links":{"citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:ab9e4924f4261d7775efe796216775ef7038265e7498eb409c0360905de35a96","observation_id":"11518c7f-6194-43b9-b38f-a2c4eae7dfa6","resolution":{"observed_at":"2026-08-06T10:21:21.791017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:21:21.775870Z","title":"Not all ex- perts are equal: Efficient expert pruning and skipping for mixture-of-experts large language models","venue":null,"work_id":"1eea8289-ba2e-43f6-8e16-2d8cd1c2f860","year":2024},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.433965Z"},"links":{"citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:fddb9f52aeb7c7908bf8d452a18daf473034ec75abda4079442ba180d16e49c5","observation_id":"61fee644-8cda-467b-9d08-33eb3dd9dfbb","resolution":{"observed_at":"2026-08-06T10:21:21.779647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:21:21.764683Z","title":"Catastrophic inter- ference in connectionist networks: The sequential learning problem","venue":null,"work_id":"e2877406-e947-4156-ad0d-4cd816db7fd2","year":1989},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.437007Z"},"links":{"citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:133306df6aca905d38aa855bc54929688bb85d18d4d6361b9c145fe42ef1b94c","observation_id":"cf2acef6-ec07-4ca3-a677-6d4a9ef772d6","resolution":{"observed_at":"2026-08-06T10:21:21.768403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:21:21.754722Z","title":"Multimodal contrastive learn- ing with limoe: the language-image mixture of experts.Ad- vances in Neural Information Processing Systems, 35:9564– 9576, 2022","venue":null,"work_id":"48f733e8-2bdf-43e3-bb04-af16cd3f1fb4","year":2022},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.440162Z"},"links":{"citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:d38d74367f9e507e039a12748eae5bab0990b69390d3df828f5f90bf4f2cb2e0","observation_id":"512af70e-e130-4b8b-a7f1-7c739dff4727","resolution":{"observed_at":"2026-08-06T10:21:21.758311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:21:21.743725Z","title":"Flickr30k entities: Collecting region-to-phrase corre- spondences for richer image-to-sentence models.Interna- tional Journal of Computer Vision, 123:74–93, 2017","venue":null,"work_id":"42c11bb4-451d-413b-860e-0a6f50e8ba71","year":2017},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.443261Z"},"links":{"citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:35c66cd686c5790492316175757016c2238b2adde4f49d627c34db3ca9c4bf31","observation_id":"c68e684d-ac33-46b2-aa90-aa2bb7345d87","resolution":{"observed_at":"2026-08-06T10:21:21.748323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:21:21.446302Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.446302Z"},"links":{"citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:5a53da631e390eade1ad2bd83e0684d02b3d6d9379d72b9b55004c788d8505f6","observation_id":"fa114b31-03a8-4d3c-bf60-47870e7f9285","resolution":{"observed_at":"2026-08-06T10:21:21.446302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:21:21.727529Z","title":"iCaRL: Incremental clas- sifier and representation learning","venue":null,"work_id":"7dfe15c2-689e-4cf6-a326-c3a4232402ef","year":2001},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.449652Z"},"links":{"citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:08d859ee9255983ccd7331ffecb327795b98177e9c31d38855fb4e19c734d1db","observation_id":"7dc32692-beca-432e-8e4b-17fde4ca2554","resolution":{"observed_at":"2026-08-06T10:21:21.730959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:21:21.717144Z","title":"Exploring models and data for image question answering.Advances in neural information processing systems, 28, 2015","venue":null,"work_id":"a7ae22b8-2729-44d7-a387-53fa3558200a","year":2015},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.452679Z"},"links":{"citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:8812e527ffa11e820f4675524bab995cd43ca8145162c8b3659684278aefe622","observation_id":"b83644da-00c9-4940-8e7b-e4593c362396","resolution":{"observed_at":"2026-08-06T10:21:21.720656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1701.06538","last_updated":"2017-01-23T18:10:00Z","snapshot_observed_at":"2026-07-06T05:27:13.416519Z","submitted_at":"2017-01-23T18:10:00Z","title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1701.06538","snapshot_observed_at":"2026-08-06T10:21:21.455817Z","title":"Outra- geously large neural networks: The sparsely-gated mixture- of-experts layer.arXiv preprint arXiv:1701.06538, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.455817Z"},"links":{"cited_paper":"/paper/1701.06538","citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:69a51adc8b0f41a5def05110033791b6073fbf9e7223077dc44dcd8a9d7e7d38","observation_id":"aa84c749-4020-40f3-b455-7c2192d7ba52","resolution":{"observed_at":"2026-08-06T10:21:21.455817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:21:21.707167Z","title":"CODA-prompt: Con- tinual decomposed attention-based prompting for rehearsal- free continual learning","venue":null,"work_id":"1bf58341-7d9a-4169-ad37-777eb6a3bde4","year":2023},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.459384Z"},"links":{"citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:92cfc7cb9074612afa39f36e754e4a6e41a70f2131eae45cadf564d094d6d923","observation_id":"90f5229b-c3f4-48f0-8f8f-30b2dbec25f2","resolution":{"observed_at":"2026-08-06T10:21:21.710769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:21:21.697182Z","title":"Constrained contrastive distribution learning for unsupervised anomaly detection and localisation in med- ical images","venue":null,"work_id":"6915c961-bd8a-43d3-b068-4113688eb5d4","year":2021},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.463488Z"},"links":{"citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:bc957749916ba289514a5d9715e01f19de746f7fbb1a36c09a333a988011f9f2","observation_id":"b5ad4abf-dce0-4b27-9427-29e05c0955ae","resolution":{"observed_at":"2026-08-06T10:21:21.700593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-06T10:21:21.467333Z","title":"Llama 2: Open foundation and fine-tuned chat models.arXiv preprint arXiv:2307.09288, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.467333Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:22db8ff12cc7b45c62724d7c786ce3d72d7ca0e7cac7b215ca2140df39d25d2d","observation_id":"1655feca-8306-4c3c-b6c9-47273b294f71","resolution":{"observed_at":"2026-08-06T10:21:21.467333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:21:21.686900Z","title":"DualPrompt: Complementary prompting for rehearsal-free continual learning","venue":null,"work_id":"746d8662-6c9c-4d3c-bc1f-5836b9d50baf","year":null},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.470608Z"},"links":{"citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:31cd5db8b4df755ad4c311e8587e8e48511234025c847a6ea43f2ec9f3e1cd9d","observation_id":"3da1cda1-5e60-4ce3-85fe-caed156eca0f","resolution":{"observed_at":"2026-08-06T10:21:21.690408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:21:21.474330Z","title":"Learning to prompt for con- tinual learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.474330Z"},"links":{"citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:2e5de860479a7c6bd2c9f4e59b9459ae0129d66dff2018e5f713a88f84566961","observation_id":"e34c4a4b-b655-4c20-8fb9-5dba204c4ec0","resolution":{"observed_at":"2026-08-06T10:21:21.474330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14178","last_updated":"2024-03-29T08:13:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-27T13:27:01Z","title":"mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14178","snapshot_observed_at":"2026-08-06T10:21:21.478032Z","title":"mPLUG-OWl: Modularization empowers large language models with multimodality.arXiv preprint arXiv:2304.14178, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.478032Z"},"links":{"cited_paper":"/paper/2304.14178","citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:b16c3c0eadac8fa936f4317d118c48eb5f66352fcb4d14cee751d26a65261c42","observation_id":"85a0656a-f59d-4f0a-96d5-9010d31056c4","resolution":{"observed_at":"2026-08-06T10:21:21.478032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:21:21.670714Z","title":"Boosting continual learning of vision-language models via mixture-of-experts adapters","venue":null,"work_id":"ad816138-eebf-43a0-87f4-1154842ba6f6","year":2024},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.481597Z"},"links":{"citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:02d847fa8980012261d7f0e6716f4d5669b543e825fbbeb74462a92b6b43a7e5","observation_id":"0e2c69be-6c75-40ee-a6d0-ba572582c434","resolution":{"observed_at":"2026-08-06T10:21:21.674647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:21:21.660486Z","title":"Contin- ual learning through synaptic intelligence","venue":null,"work_id":"55ad3117-1412-4503-b1cd-8ef8e0fdabd5","year":2017},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.485352Z"},"links":{"citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:0d7479a1d7154f39ea4169b57f0787ad5c3d375d4a4fdec03101d0f5f76e7aed","observation_id":"15c32d4d-2942-4925-a2f2-e79a44d2b491","resolution":{"observed_at":"2026-08-06T10:21:21.664041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:21:21.649182Z","title":"Investigating the catastrophic for- getting in multimodal large language models","venue":null,"work_id":"22815a36-bc05-4ab1-82f1-6909693042ca","year":2023},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.489745Z"},"links":{"citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:c1ff70d6b7b410ceb0add671d5eac5f7b6443c7309232447e4f8108353557b52","observation_id":"34554ce1-1655-4f89-9000-5f55e38d0500","resolution":{"observed_at":"2026-08-06T10:21:21.653638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15684","last_updated":"2024-05-24T16:24:10Z","snapshot_observed_at":"2026-07-06T18:19:25.869339Z","submitted_at":"2024-05-24T16:24:10Z","title":"Prompt-Aware Adapter: Towards Learning Adaptive Visual Tokens for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2405.15684","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.15684","snapshot_observed_at":"2026-08-06T10:21:21.540241Z","title":"Prompt-Aware Adapter: Towards Learning Adaptive Visual Tokens for Multimodal Large Language Models","venue":"cs.CV","work_id":"22b75ed9-1461-4ff0-8ea6-b501d6ab880b","year":2024},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.493130Z"},"links":{"cited_paper":"/paper/2405.15684","citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:f59405d4a5602d4b57c22b73285ce6b0ab63bec99a5250123da2ef12986b0f16","observation_id":"128e48f9-fff9-4e9f-b946-457d78234640","resolution":{"observed_at":"2026-08-06T10:21:21.546029Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:21:21.638048Z","title":"Preventing zero-shot transfer degradation in continual learning of vision-language models","venue":null,"work_id":"2ed9d7ec-7295-4270-9fe4-0b2d60b15104","year":2023},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.496493Z"},"links":{"citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:0a9e9c80e06ae513c2e3cacf7b48a88cea0440a47787b95574e059605f9074b3","observation_id":"7893dd5b-5c4d-451e-a26d-18c1465b73f8","resolution":{"observed_at":"2026-08-06T10:21:21.642002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-06T10:21:21.500180Z","title":"MiniGPT-4: Enhancing vision-language understanding with advanced large language models.arXiv preprint arXiv:2304.10592, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T10:21:21.500180Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2508.00260"},"observation_digest":"sha256:1b1c3b636710765d081bf60cc2d92b4d7d4e4d695190c48b05aa6463b67d6deb","observation_id":"904ad81f-2db6-4e47-bd45-2d68bd2ff969","resolution":{"observed_at":"2026-08-06T10:21:21.500180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.00260","last_updated":"2025-08-01T02:08:09Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T08:24:49.431434Z","submitted_at":"2025-08-01T02:08:09Z","title":"Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":1,"verified_fuzzy":39},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 0 inbound Pith citation observations for arXiv:2508.00260."}