{"as_of":"2026-08-11T01:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:845c4ade949cfebd0b3c4d611ee0b50da148399d17567eb0ee068586f9f11dfe","coverage":[{"denominator":83,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":83,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T06:00:27.624272Z","state":"measured"},{"denominator":83,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":83,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.04606/citation-record","integrity":"/paper/2509.04606/integrity","json":"/paper/2509.04606/citation-record.json","paper":"/paper/2509.04606"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:27.347629Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.347629Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:cc2b75765dc8f6cf11c1f683f3914a55ecf626dcef23eae7c9a0521b2ff6a131","observation_id":"2f8a0821-0365-4ce2-8ef7-be3ab526b42a","resolution":{"observed_at":"2026-08-05T06:00:27.347629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:27.351735Z","title":"METEOR: An Automatic Metric for MT Evaluation with Improved Correlation with Human Judgments","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.351735Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:70ad99e726488acd221e56fa44b361e0262280ab8397475830004ac69011ea2d","observation_id":"35edd962-0a12-493b-81a6-a225b62e64e1","resolution":{"observed_at":"2026-08-05T06:00:27.351735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:27.355363Z","title":"SciBERT: A Pretrained Language Model for Scientific Text","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.355363Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:99ec9b564b6881003cf5fe0a7df530910e9e20655aaf78cd0070becab6748312","observation_id":"729df4e2-7fdb-41c5-89f6-4abbd5723dbd","resolution":{"observed_at":"2026-08-05T06:00:27.355363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.700012Z","title":"NLTK: The Natural Language Toolkit","venue":null,"work_id":"fb03b812-fe06-4230-b667-1e4cd093f1f9","year":null},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.358727Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:a5a65be6c808b1e163b831c4c971e82b0d8007ef3c3cce39e3c5820c5cc63f16","observation_id":"52b3f11a-abd8-44a2-9194-f1f5d591dc3d","resolution":{"observed_at":"2026-08-05T06:00:28.703504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.681193Z","title":"Principled Weight Initialization for Hypernet- works","venue":null,"work_id":"ea8bd10a-16ed-440d-8691-06855b164a5f","year":2020},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.365462Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:e4b2d285922c26d30fb2e8cf10bc413459a5c4d633246df863fb2565a8ed84f9","observation_id":"bbd15379-b951-4764-81f9-08beaadec2c3","resolution":{"observed_at":"2026-08-05T06:00:28.685327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.670202Z","title":null,"venue":null,"work_id":"d9579761-667b-4cab-a03e-8b663ccd4172","year":2024},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.368816Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:a5ffcfca1d17561d62747d9ec2fb5557cb8e8f450308e34ed404a40212b6315c","observation_id":"9ce7754a-25e9-4a83-a14a-92d454518309","resolution":{"observed_at":"2026-08-05T06:00:28.673581Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.659086Z","title":"Model Composition for Multimodal Large Language Models","venue":null,"work_id":"ae62471d-4e9e-4a4c-9a6c-0b1ba34b223d","year":2024},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.371871Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:e848fb36589265d73a89906f356f7beacbb8f15a420ee92a12ea6f3edaa8b7ae","observation_id":"19d6a5c3-2dcb-4106-9e8e-a3aa651fc2e0","resolution":{"observed_at":"2026-08-05T06:00:28.662659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.10407","last_updated":"2022-03-30T06:27:02Z","snapshot_observed_at":"2026-08-10T23:18:47.031293Z","submitted_at":"2021-02-20T18:02:42Z","title":"VisualGPT: Data-efficient Adaptation of Pretrained Language Models for Image Captioning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.10407","snapshot_observed_at":"2026-08-05T06:00:27.375861Z","title":"VisualGPT: Data-efficient Image Captioning by Balancing Visual Input and Linguistic Knowledge from Pretraining.CoRR, abs/2102.10407, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.375861Z"},"links":{"cited_paper":"/paper/2102.10407","citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:dd87f4d586b2fb8b7f3aaf8277ad930f56eae095e0411f466942070e9cbb22d0","observation_id":"fe851190-7f20-4bbe-8c17-a8977c1193f0","resolution":{"observed_at":"2026-08-05T06:00:27.375861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.647732Z","title":"ShareGPT4V dataset on Huggingface, 2024","venue":null,"work_id":"702b48b8-22aa-4b53-bd92-df3f9ac6a8a2","year":2024},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.379381Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:dd1517bad2d38f83178a28322ed1fce319c6e0104a4df422a39b4da8a6d5a5f1","observation_id":"e24a920f-f6b6-4ac8-9638-295cd646cb97","resolution":{"observed_at":"2026-08-05T06:00:28.651036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12793","last_updated":"2023-11-28T08:52:50Z","snapshot_observed_at":"2026-08-04T08:17:54.774738Z","submitted_at":"2023-11-21T18:58:11Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12793","snapshot_observed_at":"2026-08-05T06:00:27.382458Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.382458Z"},"links":{"cited_paper":"/paper/2311.12793","citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:96f6ffc35ec2277bc2f15d947654514167058fe067108fa20088d99736f36209","observation_id":"3eca805e-75f3-48af-84b9-e36cdc55ae61","resolution":{"observed_at":"2026-08-05T06:00:27.382458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-07-06T18:26:42.010940Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-05T06:00:27.385958Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.385958Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:064861effd9ffaa8f4f73e545923b86c91983f532aa5adf50e7e65609bc8f113","observation_id":"0aa4d782-5645-4153-abea-5c2f8d9af55e","resolution":{"observed_at":"2026-08-05T06:00:27.385958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.636556Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","venue":null,"work_id":"fdd95d2a-db2b-46c8-82cc-b977937097b0","year":2023},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.389467Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:fd25823ffdb8ccf17349c997947a668a1c150a4bee7d686e13a6bdc95ca1233e","observation_id":"14282f81-28c1-4c87-baac-c5f0769d31ae","resolution":{"observed_at":"2026-08-05T06:00:28.640423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.625784Z","title":"Clotho: an Audio Captioning Dataset","venue":null,"work_id":"0d203448-ccfe-4645-89fc-e7905fbc01c6","year":2020},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.392519Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:336a3bef47d26a773513c9380636b42d0b0d1d2c09124394c5d9af76d4b170a0","observation_id":"b7772c53-2d53-42a6-8b50-6866bcdceab5","resolution":{"observed_at":"2026-08-05T06:00:28.629325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-05T06:00:27.395415Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.395415Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:ef1f6ba33a99f85827acd5b87d1100071237d33e709e2f61d77a5c5dd4319753","observation_id":"64d0fa1a-de22-41d4-83a9-4f47178f035a","resolution":{"observed_at":"2026-08-05T06:00:27.395415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.613692Z","title":"Translation between Molecules and Natural Language","venue":null,"work_id":"9eaf0f37-e3ad-4ece-9064-302c6e525f91","year":2022},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.398553Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:110a5fdca9aef5442d96903ec3d556a9c4abc34668763740fba8b6359cfe82eb","observation_id":"1ba264ee-f0f7-426d-82cb-12b582238489","resolution":{"observed_at":"2026-08-05T06:00:28.617697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.599880Z","title":"Text2Mol: Cross-Modal Molecule Retrieval with Natural Language Queries","venue":null,"work_id":"ffa37239-aa00-4501-a619-363e00697b43","year":2021},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.401720Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:5c38a6365c62a1d98e712e392fa86f7ec9b7b10b6f63d12503241dcf3339f865","observation_id":"1ebccddf-3e33-4d6f-b15e-0aee71e19356","resolution":{"observed_at":"2026-08-05T06:00:28.604214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.585225Z","title":"CLAP: Learning Audio Concepts From Natural Language Supervision","venue":null,"work_id":"fdb14aa4-bd09-42e0-8210-710cc9e9c413","year":2023},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.405152Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:5d0ba712c2eb298b469721a99292b1f63797eef552744b8098012750112e95b3","observation_id":"6e368e0f-ea9c-4e09-8204-85e6726c689d","resolution":{"observed_at":"2026-08-05T06:00:28.591261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.15010","last_updated":"2023-04-28T17:59:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-28T17:59:25Z","title":"LLaMA-Adapter V2: Parameter-Efficient Visual Instruction Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.15010","snapshot_observed_at":"2026-08-05T06:00:27.408297Z","title":"LLaMA-Adapter V2: Parameter- Efficient Visual Instruction Model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.408297Z"},"links":{"cited_paper":"/paper/2304.15010","citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:daafe6a6520688b7b058f5b101027da80671b247aaedd99caf74a25156b8a10a","observation_id":"1103c595-0c97-45a9-950a-6ee92563f76d","resolution":{"observed_at":"2026-08-05T06:00:27.408297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01218","last_updated":"2023-10-02T14:03:02Z","snapshot_observed_at":"2026-08-02T03:02:58.907220Z","submitted_at":"2023-10-02T14:03:02Z","title":"Making LLaMA SEE and Draw with SEED Tokenizer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01218","snapshot_observed_at":"2026-08-05T06:00:27.412176Z","title":"Making LLaMA SEE and Draw with SEED Tokenizer","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.412176Z"},"links":{"cited_paper":"/paper/2310.01218","citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:35e264dc4d57e9db75f1ba7f66e88a41b3a08785fc321ca0f2b4e312fe7004b6","observation_id":"27c96fe5-b1de-46d0-b399-c6852e091228","resolution":{"observed_at":"2026-08-05T06:00:27.412176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02080","last_updated":"2025-06-10T22:29:42Z","snapshot_observed_at":"2026-08-07T04:26:25.661223Z","submitted_at":"2024-10-02T23:00:31Z","title":"EMMA: Efficient Visual Alignment in Multi-Modal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02080","snapshot_observed_at":"2026-08-05T06:00:27.415722Z","title":"EMMA: Efficient Visual Alignment in Multi-Modal LLMs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.415722Z"},"links":{"cited_paper":"/paper/2410.02080","citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:5365fc0f05b89cc86434631e8961881cf78438f319c25ff5a6829f5cbd7becd4","observation_id":"912c348b-6a3c-48db-96fc-aa5f64be68fc","resolution":{"observed_at":"2026-08-05T06:00:27.415722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.571556Z","title":"Agent Smith: A Single Image Can Jailbreak One Million Multimodal LLM Agents Exponentially Fast","venue":null,"work_id":"7fbcb21a-2f75-4f79-bc4b-2086b7342716","year":2024},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.418978Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:8b77cdbd9cf073ff205bf4c18fa2fa336a89692bae292a3d61991a7e836fd3d7","observation_id":"5eda6399-96e9-45f9-af9a-e946405d6d62","resolution":{"observed_at":"2026-08-05T06:00:28.575918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.556933Z","title":"LLaV A-UHD: an LMM Perceiving Any Aspect Ratio and High-Resolution Images","venue":null,"work_id":"9a5518e5-e626-45ce-927c-7c5da24469fb","year":2024},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.422124Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:65a0011b37da18ec53df5bf09c776ab2e307a66baede084770f65b9786073f69","observation_id":"79ad8104-c7ca-4c61-8ac2-8b86a7a5e8c3","resolution":{"observed_at":"2026-08-05T06:00:28.561245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:27.425765Z","title":"Dai, and Quoc V","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.425765Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:a7a9ad2548d520a9fa361466eae1f4e939e92678dcb22d61b0bca634dc16cf31","observation_id":"a549f9c2-ebdf-4abc-a3ff-a396a4ce82ea","resolution":{"observed_at":"2026-08-05T06:00:27.425765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.534540Z","title":"OneLLM: One Framework to Align All Modalities with Language","venue":null,"work_id":"4fb72fe7-fd08-478d-a972-49b3cdae6af3","year":2023},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.429211Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:857c888b51543a45fac0e1811175caeabd4143b0d3e49203e2f3429044098d2a","observation_id":"4d8b8bbb-665b-4024-9e3f-73964e03a978","resolution":{"observed_at":"2026-08-05T06:00:28.538597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.03905","last_updated":"2023-09-11T20:25:16Z","snapshot_observed_at":"2026-08-08T23:15:31.134799Z","submitted_at":"2023-09-07T17:59:45Z","title":"ImageBind-LLM: Multi-modality Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.03905","snapshot_observed_at":"2026-08-05T06:00:27.432652Z","title":"ImageBind-LLM: Multi-modality Instruction Tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.432652Z"},"links":{"cited_paper":"/paper/2309.03905","citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:7ff24f5b999bc2b41c56b2101bc4273af4688196c385df06cbb3a2be83acc993","observation_id":"8fb48564-3338-471f-88f6-13dfb234a78f","resolution":{"observed_at":"2026-08-05T06:00:27.432652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.522283Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","venue":null,"work_id":"b367d2aa-89a6-4b75-853d-c3a7d6d6403f","year":2022},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.436010Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:65587a92bf573444278c64937faf6480f42b3e7aee20998e176a3e05c85a6220","observation_id":"3756b43c-dc7a-4a96-ba0f-8f101e1ff9a1","resolution":{"observed_at":"2026-08-05T06:00:28.526391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.509011Z","title":"LLaSA: A Multimodal LLM for Human Activity Analysis Through Wearable and Smartphone Sensors, 2025","venue":null,"work_id":"5a65f917-fb04-4515-8a02-5a86f9b2065d","year":2025},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.439379Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:babb3647dff230223e5286bb263e16936d1bbc7b8ad6de094a3bd91b4d854267","observation_id":"993d4154-8fc3-44c6-896a-9daf23210c83","resolution":{"observed_at":"2026-08-05T06:00:28.513624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.496636Z","title":"Perceiver: General perception with iterative attention","venue":null,"work_id":"cadfa308-eed6-4f35-a086-f552336f4560","year":2021},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.442577Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:87b8541df0ea0f773d22d9f22be9be7783efab03e6d284860e4d3f8b0c5b43fb","observation_id":"3e8306e1-0848-46f6-8487-e35a0a2f6913","resolution":{"observed_at":"2026-08-05T06:00:28.500779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.11694","last_updated":"2025-03-04T01:47:20Z","snapshot_observed_at":"2026-07-06T20:07:41.462631Z","submitted_at":"2024-12-16T12:12:45Z","title":"From Specific-MLLMs to Omni-MLLMs: A Survey on MLLMs Aligned with Multi-modalities","version":3},"cited_work":{"arxiv_id":"2412.11694","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.11694","snapshot_observed_at":"2026-08-05T06:00:27.821608Z","title":"From Specific-MLLMs to Omni-MLLMs: A Survey on MLLMs Aligned with Multi-modalities","venue":"cs.AI","work_id":"340e1bc3-d96f-4bad-b23f-afa1b011a51e","year":2024},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.446056Z"},"links":{"cited_paper":"/paper/2412.11694","citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:13993fd0b562616fba5f2914b4a7705136789573717eeecfa2bdb4f8156c5704","observation_id":"6a7c9cf0-32e4-4045-b016-693b24c42168","resolution":{"observed_at":"2026-08-05T06:00:27.825437Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.483965Z","title":"BRA VE: Broadening the visual encoding of vision-language models","venue":null,"work_id":"0d9e3a9c-8af2-42d6-84d4-c2a61d957316","year":2024},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.449348Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:b48b3da2a19ef98af9046e79f4b9993b92dcc2ab40f9a0ab13ab33327120b302","observation_id":"6ccff54a-d44c-4845-b21d-471410198c47","resolution":{"observed_at":"2026-08-05T06:00:28.488538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.471675Z","title":"AudioCaps: Generat- ing Captions for Audios in The Wild","venue":null,"work_id":"a7caa924-cca9-4b0c-a913-e15ef2f3d8d5","year":2019},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.452422Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:0896109b551e60373c24a7450ff9191a4313686b848a81580e3d03cc6396b01c","observation_id":"5edaaa22-d115-4203-880c-7d10b2aae347","resolution":{"observed_at":"2026-08-05T06:00:28.475757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.459504Z","title":"Berg, Wan-Yen Lo, Piotr Dollár, and Ross Girshick","venue":null,"work_id":"92c3bbfa-5ed7-4d2a-8f26-5a66958d69be","year":2023},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.455363Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:06957af9fc2ca74b9570f454fef5525dbd7e223ca50accf330cd97ab381542ed","observation_id":"e5a895ed-7f85-40bc-bd2c-95ed9902fdfb","resolution":{"observed_at":"2026-08-05T06:00:28.463360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.446502Z","title":"Grounding Language Models to Images for Multimodal Inputs and Outputs","venue":null,"work_id":"6689c5c7-0719-4bef-8e6d-7298372a19f2","year":2023},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.458606Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:1198c5e9d0cb0fec0167afcc06031c4a8856ec29a71cd0bae0642fa2e9e9fabb","observation_id":"70e4e688-3944-4b69-ba28-cdcfd69fbb46","resolution":{"observed_at":"2026-08-05T06:00:28.450784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.433497Z","title":"Similarity of Neural Network Representations Revisited","venue":null,"work_id":"54df2ceb-94e3-4a88-afed-1b2332d0c081","year":2019},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.461671Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:018da10c978ffbc56c159e617e6d05085c63891752708d82ba7cd61b7bef317a","observation_id":"410e7e59-5465-4f53-9c74-82f025fd582c","resolution":{"observed_at":"2026-08-05T06:00:28.438000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.419895Z","title":"BLIP-2: Bootstrapping Language- Image Pre-training with Frozen Image Encoders and Large Language Models","venue":null,"work_id":"8df29366-944d-4113-9161-2fc940008fcb","year":2023},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.464656Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:8b82d3c8377df8343f43296748b766d9f33c6c3455ec1f2ed7d354280841f9a8","observation_id":"47bbeb76-782f-479b-b373-16a39136b1c4","resolution":{"observed_at":"2026-08-05T06:00:28.424302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.405086Z","title":"ROUGE: A Package for Automatic Evaluation of Summaries","venue":null,"work_id":"2652c993-bc6c-4c17-b602-5ac46cf0599f","year":2004},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.467551Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:91cbcb79676dce677ad410d4c77299c7e083c261eb705cd969e45ab3fecc14ee","observation_id":"3b6937e0-cc9f-42bf-941b-486f4c5c9a54","resolution":{"observed_at":"2026-08-05T06:00:28.410018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.387386Z","title":"Microsoft COCO: Common Objects in Context","venue":null,"work_id":"ba87087e-d859-4276-927f-fea2a4cf06b1","year":2014},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.470601Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:b8f6c5b74baf733fbc1b9a10c850693f97df4e8f29d840c868782c2572512db9","observation_id":"1b2041eb-84c7-4528-a5e9-8425833a6672","resolution":{"observed_at":"2026-08-05T06:00:28.390858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.375477Z","title":"RemoteCLIP: A Vision Language Foundation Model for Remote Sensing","venue":null,"work_id":"c459dcaf-7f6e-4cc7-a47e-ae0cdfbf8920","year":2024},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.473606Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:bc12b56a06e635c473eb9950d325cb6c6b3e1b0e3d3d6492185182c2375d62ae","observation_id":"1530c413-d2ef-4443-9c87-2b92df2bdeff","resolution":{"observed_at":"2026-08-05T06:00:28.379327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.363959Z","title":"Visual Instruction Tuning","venue":null,"work_id":"c77dac36-ca11-4067-a408-71a0975fbc55","year":2023},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.476988Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:bd483f861876c3e6430589349d261fa92514c51e5494c1658dd8674339adc697","observation_id":"f00a18b6-377b-4d8a-8914-157951fad862","resolution":{"observed_at":"2026-08-05T06:00:28.367870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18277","last_updated":"2025-08-04T02:46:55Z","snapshot_observed_at":"2026-07-06T20:12:40.901520Z","submitted_at":"2024-12-24T08:38:35Z","title":"Towards Modality Generalization: A Benchmark and Prospective Analysis","version":3},"cited_work":{"arxiv_id":"2412.18277","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.18277","snapshot_observed_at":"2026-08-05T06:00:27.805853Z","title":"Towards Modality Generalization: A Benchmark and Prospective Analysis","venue":"cs.CV","work_id":"785f334c-814e-4f2d-a042-a14b7872f00c","year":2024},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.480243Z"},"links":{"cited_paper":"/paper/2412.18277","citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:83c9531d304ac85abc6238f2076bc725f416bbb541a115e1cae345da4793c68b","observation_id":"aba6bf0d-27e2-487e-a2ea-e18e0be18511","resolution":{"observed_at":"2026-08-05T06:00:27.809540Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.351275Z","title":"MolCA: Molecular Graph-Language Modeling with Cross-Modal Projector and Uni-Modal Adapter","venue":null,"work_id":"5c5ad169-7520-4752-a97d-7b425a6b367f","year":2023},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.483716Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:d592d34eaf629005d3706e2cd86462d9b3bdc7a87bf1e35f4d78428aa2d32fac","observation_id":"7145ebd3-d921-42d2-b6fc-0ae92354a1e1","resolution":{"observed_at":"2026-08-05T06:00:28.355361Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.338327Z","title":"Decoupled Weight Decay Regularization","venue":null,"work_id":"c059765d-ab68-46dc-8651-6cb2fe3ff2e1","year":2019},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.486991Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:e2939579826b4bb0af02aedccc91b0d19af8f62a4e882c575001c47f74ab52f0","observation_id":"b068d0a7-f7fb-4fd8-b534-1c9debf1bf03","resolution":{"observed_at":"2026-08-05T06:00:28.341981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.325487Z","title":"Unified-IO 2: Scaling Autoregressive Multimodal Models with Vision Language Audio and Action","venue":null,"work_id":"344c3524-511a-4e72-8916-b03ebaad574e","year":2024},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.490226Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:8dcde86091b1befb35cb3e2b7208760ff72126af4cb7e2967481b38af1186d9c","observation_id":"aeaf28d6-da97-4e4f-bdf3-fbeffc03cd5b","resolution":{"observed_at":"2026-08-05T06:00:28.329505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09093","last_updated":"2023-06-15T12:45:25Z","snapshot_observed_at":"2026-07-06T15:42:56.285045Z","submitted_at":"2023-06-15T12:45:25Z","title":"Macaw-LLM: Multi-Modal Language Modeling with Image, Audio, Video, and Text Integration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09093","snapshot_observed_at":"2026-08-05T06:00:27.493319Z","title":"Macaw-LLM: Multi-Modal Language Modeling with Image, Audio, Video, and Text Integration","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.493319Z"},"links":{"cited_paper":"/paper/2306.09093","citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:461b317926acd4cd922d8842029a5106d1a6dd4ec5ea78b8257cfb1ed0fb4f55","observation_id":"99f01e68-3340-4ab5-be81-98fc9dd23528","resolution":{"observed_at":"2026-08-05T06:00:27.493319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11795","last_updated":"2025-04-06T18:52:08Z","snapshot_observed_at":"2026-08-04T05:24:14.383678Z","submitted_at":"2024-08-21T17:36:37Z","title":"EE-MLLM: A Data-Efficient and Compute-Efficient Multimodal Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11795","snapshot_observed_at":"2026-08-05T06:00:27.496538Z","title":"Ee-mllm: A data-efficient and compute-efficient multi- modal large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.496538Z"},"links":{"cited_paper":"/paper/2408.11795","citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:e3177109ad78e7b1501aaa8286ec9d1f217147d321722e2b06d021584f85f560","observation_id":"4372f23f-e849-4011-8f2b-518adbcbefae","resolution":{"observed_at":"2026-08-05T06:00:27.496538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.204494Z","title":"Plumbley, Yuexian Zou, and Wenwu Wang","venue":null,"work_id":"31572375-1cce-459d-836d-cea58b8d25d8","year":2024},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.499842Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:1aea3296bc9769946443e12c303b92d17a21f4ded7438a717cdc753810f3e416","observation_id":"116e1676-346a-4046-8834-fae435df3ac7","resolution":{"observed_at":"2026-08-05T06:00:28.315326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.192518Z","title":"Llama 3.2: Model Cards and Prompt formats, 2024","venue":null,"work_id":"ef8fe5df-b520-4e5f-90d9-ba978c0e8638","year":2024},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.502939Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:10f730abc9677b43f24745b08fdc0bfdd3cd7644e886bf81f2e81d41cd2cfe23","observation_id":"2ad69d09-bf8d-44c9-9275-b7aa87aa94ff","resolution":{"observed_at":"2026-08-05T06:00:28.196530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:27.506008Z","title":"How to generate random matrices from the classical compact groups","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.506008Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:423a909bd508d0c15ac00b294526ebd5ba79b3f5280efed9ac6924ff707dcb33","observation_id":"d1028c33-f00c-49c3-b1c5-5f327fd2f56d","resolution":{"observed_at":"2026-08-05T06:00:27.506008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09734","last_updated":"2021-11-18T14:49:15Z","snapshot_observed_at":"2026-08-10T13:00:45.507281Z","submitted_at":"2021-11-18T14:49:15Z","title":"ClipCap: CLIP Prefix for Image Captioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09734","snapshot_observed_at":"2026-08-05T06:00:27.509894Z","title":"Clipcap: Clip prefix for image captioning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.509894Z"},"links":{"cited_paper":"/paper/2111.09734","citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:744c22e9c47e449539d50f8bfd468f8a6b6c5ea1d057b5a022fabb330b550303","observation_id":"5d63d557-c52c-4e6c-9495-328a74914cf5","resolution":{"observed_at":"2026-08-05T06:00:27.509894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.173192Z","title":"AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model","venue":null,"work_id":"1abd684a-6544-421d-b32e-ad8a68fa28d8","year":2024},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.513165Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:9ebb651ec252a86bc94da2d4b87f205558737a378be59602017838acfe8cfe4a","observation_id":"0a628394-0a09-4331-b85c-a18ea26eb6e3","resolution":{"observed_at":"2026-08-05T06:00:28.176631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.162563Z","title":"OpenVid dataset on Huggingface, 2025","venue":null,"work_id":"e31f3522-caaa-4b6d-b551-8451129f72ff","year":2025},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.516484Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:4584c1009313f821c8d6405124025553fcacfe3766dbf08dec51c6ebcfc49bc2","observation_id":"c0b7fb79-d23f-4684-9764-60dda416267b","resolution":{"observed_at":"2026-08-05T06:00:28.165935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02371","last_updated":"2025-02-13T10:13:24Z","snapshot_observed_at":"2026-08-07T10:03:56.902190Z","submitted_at":"2024-07-02T15:40:29Z","title":"OpenVid-1M: A Large-Scale High-Quality Dataset for Text-to-video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02371","snapshot_observed_at":"2026-08-05T06:00:27.519716Z","title":"Openvid-1m: A large-scale high-quality dataset for text-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.519716Z"},"links":{"cited_paper":"/paper/2407.02371","citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:870dbc3424b1908ca2daab709b70fa6c4c8ca9d22618e8f8f093e8ef47f8f795","observation_id":"b91db0cc-236d-4a03-a3c4-de4658f9d540","resolution":{"observed_at":"2026-08-05T06:00:27.519716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.152043Z","title":"Bleu: a method for automatic evaluation of machine translation","venue":null,"work_id":"be0e9588-0d96-47bd-ad4f-7531b2f3d0a9","year":2002},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.522906Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:8b4a5339f82a8207f5bec58c6404f3ad2b6fb7d095446aa5e2d717cc1fb6069e","observation_id":"e82ef18e-2ef2-4cb8-89ea-d3bb25a089cb","resolution":{"observed_at":"2026-08-05T06:00:28.155546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.141591Z","title":"Modular Deep Learning","venue":null,"work_id":"434b281e-87ae-4bd0-8340-5d2defbe3626","year":2023},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.526137Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:b529efb21eede9c072997e63dbe8970fe52e28b81c44bbf028514dcfacdf7a23","observation_id":"45355158-fd17-4652-aa87-465c17214da6","resolution":{"observed_at":"2026-08-05T06:00:28.144811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.130875Z","title":"Deep semantic understanding of high resolution remote sensing image","venue":null,"work_id":"a57c705d-2d38-4315-a8d0-bf473142cbbe","year":2016},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.529445Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:3a116b2fb8ec537fc8c7265891342e4e237b9cd12a5d72179914198d4e1ddf0c","observation_id":"88bb21eb-b2c7-48ae-b731-94cb9a456215","resolution":{"observed_at":"2026-08-05T06:00:28.134440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.118937Z","title":"Learning Transferable Visual Models From Natural Language Supervision","venue":null,"work_id":"c5d43d6b-276c-451c-9a93-d38b2069ebab","year":2021},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.532742Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:46f2a5ce28406ad1fb423c13c30ad23d35b416e8dd458e19a61fb55cda2c8637","observation_id":"2471ce79-5042-4631-9297-e580c3a5cf42","resolution":{"observed_at":"2026-08-05T06:00:28.122972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.107645Z","title":"Infinite Feature Selection","venue":null,"work_id":"e57eb588-1723-4697-8eab-e81710f1e1a5","year":2015},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.536144Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:8699cf7fbd1ec84453cdc8e4653028236839077877c6c67f946ff43657f12225","observation_id":"09cff91f-84e2-44ef-9153-db1ab708336d","resolution":{"observed_at":"2026-08-05T06:00:28.110868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.096499Z","title":"Learning to Control Fast-Weight Memories: An Alternative to Dynamic Recurrent Networks","venue":null,"work_id":"cfde05a4-a98a-4cdb-932f-3b8ed9ff0940","year":1992},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.539441Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:4d1835aa966b5de4706779d915c08e2070f32c63c35983380f41456bad1d97ae","observation_id":"df8e9ebc-f2d4-4190-abc8-4a6b7f8280e9","resolution":{"observed_at":"2026-08-05T06:00:28.100280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.085889Z","title":"UnIV AL: Unified Model for Image, Video, Audio and Language Tasks","venue":null,"work_id":"d5d5cfbe-4a59-478c-add0-5adb6006fd47","year":2023},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.542610Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:6bdd46f534e72299cf52e248dcb883b0c86b1cc4bcbbd5d356f28c585a28512f","observation_id":"b65c02e6-114d-4691-9073-3af225c6bbe5","resolution":{"observed_at":"2026-08-05T06:00:28.089097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.075534Z","title":null,"venue":null,"work_id":"9574f1c7-0c32-433b-a40c-2c0c039808a4","year":2016},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.545801Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:a8aa925d4537972fc14f75df14bed37aad43266c5f9562b2ff27f3740671f17b","observation_id":"065fe912-a0a2-40fb-bb8c-2b7844c3de9b","resolution":{"observed_at":"2026-08-05T06:00:28.078605Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-05T06:00:27.551011Z","title":"Siglip 2: Multilingual vision-language encoders with improved semantic understanding, localization, and dense features","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.551011Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:dddccc78751cefd3c9dd29f92dace42cfa43f9b39c845bdab175207025922b84","observation_id":"06cd99be-7f6e-4b47-a0a9-b8759a0335c2","resolution":{"observed_at":"2026-08-05T06:00:27.551011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.064888Z","title":"Lawrence Zitnick, and Devi Parikh","venue":null,"work_id":"5092dbe6-4865-4127-a916-2d7a89989f8d","year":2015},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.554566Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:13e3acaad41997f276a108d1013f6a1b1d8aae2b5c24c8d1e0cf2929de019f4f","observation_id":"83ee673b-fed5-4190-9dbc-1a784b41c091","resolution":{"observed_at":"2026-08-05T06:00:28.068294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:27.557681Z","title":"Oliphant, Matt Haberland, Tyler Reddy, David Cournapeau, Evgeni Burovski, Pearu Peterson, Warren Weckesser, Jonathan Bright, Stéfan J","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.557681Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:606662c58a59299ce7175f7533bae96e0b9c12ba1b2399165ccff80c3d7b4498","observation_id":"2aa65663-85ad-4b37-9acd-f26d47b7cf75","resolution":{"observed_at":"2026-08-05T06:00:27.557681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.046404Z","title":"Lintott, Anna M","venue":null,"work_id":"78acbcb5-7460-47ce-84db-f73274f53373","year":2023},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.560972Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:9c513d118a107303b0b0bf728fc1ceeb19b0e361e8c5d6c035f32a009dd9f89a","observation_id":"714d31d7-7257-474c-b718-a6ff75543756","resolution":{"observed_at":"2026-08-05T06:00:28.049939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.035552Z","title":"VideoCLIP-XL: Advancing Long Description Understanding for Video CLIP Models","venue":null,"work_id":"85fc0aa1-f16d-494e-b809-0e1005682cff","year":2024},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.564228Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:f626a683581996c43ba3aa4c9189f13fe94aff40c7c2ad7f1d4ceb66f456a10d","observation_id":"ba69f3cf-0738-4f6a-82a3-b0475ae8264c","resolution":{"observed_at":"2026-08-05T06:00:28.039379Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.024835Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","venue":null,"work_id":"528de7d1-eed9-4d20-999f-0a2fb0294881","year":2024},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.570781Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:f33ee3e8e7adcd7974fdd61dac69cdead2ff6d5a86076f5fdc16b8061760b02b","observation_id":"f8971ecb-6003-4539-ba2a-3fcfbe8ffbae","resolution":{"observed_at":"2026-08-05T06:00:28.028294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13663","last_updated":"2024-12-19T06:32:26Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T09:39:44Z","title":"Smarter, Better, Faster, Longer: A Modern Bidirectional Encoder for Fast, Memory Efficient, and Long Context Finetuning and Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13663","snapshot_observed_at":"2026-08-05T06:00:27.573725Z","title":"Smarter, better, faster, longer: A modern bidirectional encoder for fast, memory efficient, and long context finetuning and inference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.573725Z"},"links":{"cited_paper":"/paper/2412.13663","citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:0d47607ad2e1ddd44ceb29015f2a121629884c40ffffc1e6b5e7ff06ae899d50","observation_id":"38a5db5a-596c-4fbb-9e11-11d8df1baf15","resolution":{"observed_at":"2026-08-05T06:00:27.573725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.013746Z","title":"Transformers: State-of-the-Art Natural Language Processing","venue":null,"work_id":"f498c34a-611b-4c93-adeb-c86595a72b69","year":2020},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.576922Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:2d7865bb6b94ef1450a1925b1349a7fe41aa8b6e126998e1f057a747921491b0","observation_id":"35ae5dbd-7ec6-4a06-917d-7b61e45e5cc5","resolution":{"observed_at":"2026-08-05T06:00:28.017360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:28.002020Z","title":"Limu-bert: Unleashing the potential of unlabeled data for imu sensing applications","venue":null,"work_id":"97a231a2-9472-4904-bfe6-0bcdfb8c2cf5","year":2021},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.580025Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:f4a47cf3efefaa276b75fa42a2f005edc25eb62b2bbba704b7050424f1cb988c","observation_id":"d57081dc-078e-482f-869d-5bf3a69b0578","resolution":{"observed_at":"2026-08-05T06:00:28.006073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-05T06:00:27.582998Z","title":"Qwen2.5-Omni Technical Report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.582998Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:4e4620913cbe9ed7dff48e6243a8d6774c259d3cdfc60995093d9d22b6aaa474","observation_id":"396c02a5-18ac-4eff-9306-1495825b592a","resolution":{"observed_at":"2026-08-05T06:00:27.582998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:27.991246Z","title":null,"venue":null,"work_id":"762ab18a-2e0c-4dac-b56f-9faac869ac7e","year":2023},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.586159Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:13645d4f918d7da81789d5ee69dc19a43487e575d5249b05fb0a93944d145e9c","observation_id":"3fdba7af-492d-4d0f-b0dd-cec169b87870","resolution":{"observed_at":"2026-08-05T06:00:27.994488Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-05T06:00:27.589509Z","title":"Qwen2.5 Technical Report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.589509Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:be921fa27b0ee81a1391441c2d0e5ccc09d1da47f06847fd511c7bb3befc1dff","observation_id":"d2816582-8cf1-40cd-a92b-c27dbebd0320","resolution":{"observed_at":"2026-08-05T06:00:27.589509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20178","last_updated":"2024-11-12T14:45:18Z","snapshot_observed_at":"2026-08-10T07:40:18.117207Z","submitted_at":"2024-10-26T13:19:57Z","title":"LLMs Can Evolve Continually on Modality for X-Modal Reasoning","version":2},"cited_work":{"arxiv_id":"2410.20178","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.20178","snapshot_observed_at":"2026-08-05T06:00:27.696089Z","title":"LLMs Can Evolve Continually on Modality for X-Modal Reasoning","venue":"cs.AI","work_id":"04bc0b25-cda5-4f32-a2da-1856871ebb82","year":2024},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.592640Z"},"links":{"cited_paper":"/paper/2410.20178","citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:0a89914e02fb2288b267115f55b336f51d0e479f44d9309cbd00b96ad379bd11","observation_id":"2af74947-098a-483b-ab64-0990bff056af","resolution":{"observed_at":"2026-08-05T06:00:27.701532Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:27.979498Z","title":"How Johnny Can Persuade LLMs to Jailbreak Them: Rethinking Persuasion to Challenge AI Safety by Humanizing LLMs","venue":null,"work_id":"72bd982c-67bc-4195-a178-c9e6a52c0bf9","year":2024},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.595818Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:9415a676103c0723c6bdb0b825888c241259451ff105f46d61ef9f7493a5dd6d","observation_id":"c7bb3cb0-985f-44da-912d-6e0014e90558","resolution":{"observed_at":"2026-08-05T06:00:27.983294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:27.968052Z","title":"mGTE: Generalized Long-Context Text Repre- sentation and Reranking Models for Multilingual Text Retrieval","venue":null,"work_id":"3412d5c7-41ee-4271-805d-045c2cd894c5","year":2024},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.598926Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:144aa13485ab46be67e1ec780385f780b34db4ed5e97b556ba2434b38ac30aba","observation_id":"e0cbbb4c-d38f-494b-a063-ed1dea6042b5","resolution":{"observed_at":"2026-08-05T06:00:27.971424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08581","last_updated":"2023-07-17T15:51:47Z","snapshot_observed_at":"2026-08-10T13:18:06.198450Z","submitted_at":"2023-07-17T15:51:47Z","title":"BuboGPT: Enabling Visual Grounding in Multi-Modal LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08581","snapshot_observed_at":"2026-08-05T06:00:27.602134Z","title":"BuboGPT: Enabling Visual Grounding in Multi-Modal LLMs","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.602134Z"},"links":{"cited_paper":"/paper/2307.08581","citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:7cd724601520db24546924ac973165214755acf282cff30f00e509650040aa52","observation_id":"53b8dd4b-32b5-4d04-9ea1-3fbce746d8fd","resolution":{"observed_at":"2026-08-05T06:00:27.602134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16103","last_updated":"2023-05-25T14:34:08Z","snapshot_observed_at":"2026-07-06T15:33:23.984280Z","submitted_at":"2023-05-25T14:34:08Z","title":"ChatBridge: Bridging Modalities with Large Language Model as a Language Catalyst","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16103","snapshot_observed_at":"2026-08-05T06:00:27.605436Z","title":"ChatBridge: Bridging Modalities with Large Language Model as a Language Catalyst","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.605436Z"},"links":{"cited_paper":"/paper/2305.16103","citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:c873ea7f7efbc342ea20f3cfb2e252c2318e7ec063d732e76e6227fdfdb7cff2","observation_id":"6a7a34cb-c281-41c8-abac-505375f9ec0c","resolution":{"observed_at":"2026-08-05T06:00:27.605436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-05T06:00:27.608859Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.608859Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:5a71eea326b2471c466273786977112ab608107fd7fd3eacdcb1f809c21ad228","observation_id":"9b8ceade-5c08-4bbb-9497-fdc74bf1db83","resolution":{"observed_at":"2026-08-05T06:00:27.608859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:27.957205Z","title":"Is the galaxy simply smooth and rounded, with no sign of a disk?","venue":null,"work_id":"4776b66b-3988-466c-adb5-830e2fed0532","year":2024},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.612486Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:6c93c59888a6770cd9f06d58341939fd919878de0a38bc7d1c7795e4ab154d54","observation_id":"254d9617-c361-47c5-b298-3e8e563902a8","resolution":{"observed_at":"2026-08-05T06:00:27.960786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:27.946401Z","title":null,"venue":null,"work_id":"3d1b941e-f622-4b76-92dd-320d9d10e5ef","year":null},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.617130Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:296b5612187d84caa48b8fbf12d56c69d2d43fd255c2fc0bbf57646ba6d1c500","observation_id":"7291263e-a0ad-480d-af16-6666aa8f9f78","resolution":{"observed_at":"2026-08-05T06:00:27.949757Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:27.935528Z","title":"The data is relatively stable, with slight variations, suggesting a stationary position","venue":null,"work_id":"29bb6f10-159a-48ba-93e7-e4d5a7b3120e","year":null},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.620778Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:50dafc88bfa2629ed577a9fa6271d1c94b6235e19cf3101b1df17fb17cb3065d","observation_id":"e31ae708-c7e4-44cc-98ae-9ae3a20f21a7","resolution":{"observed_at":"2026-08-05T06:00:27.939037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:27.924597Z","title":null,"venue":null,"work_id":"2755884a-a0fa-45a7-a9aa-cbfd68d4a3c8","year":2048},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.624272Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:2995dbba246fe757b41e338de7a2eea99e1fb894cf826a252aeda06b293ef91b","observation_id":"55f64af5-3588-491d-93aa-da81bf28f94b","resolution":{"observed_at":"2026-08-05T06:00:27.928041Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:27.567671Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.567671Z"},"links":{"citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:c7f7e682414d1b689c76a59ddd0b79a0990ca798baf05d3d77da27cecce51748","observation_id":"82894495-20ad-4c57-bf11-a92290711c48","resolution":{"observed_at":"2026-08-05T06:00:27.567671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T23:16:34.034930Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models"},"reference_resolution":{"displayed":83,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":30,"verified_exact":3,"verified_fuzzy":49},"total_outbound_references":83},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 83 of 83 outbound references and 0 inbound Pith citation observations for arXiv:2509.04606."}