{"as_of":"2026-08-10T08:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:eb9d54de14b48901657f066ea6c3a71b37ef6d46b946b331c7bcc48a2ae88da0","coverage":[{"denominator":24,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:46:00.186219Z","state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.07415/citation-record","integrity":"/paper/2507.07415/integrity","json":"/paper/2507.07415/citation-record.json","paper":"/paper/2507.07415"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:46:00.352019Z","title":"Cma-clip: Cross- modality attention clip for text-image classification,","venue":null,"work_id":"e0688bd4-cb88-4904-8082-368343e1b411","year":2022},"citing_paper":{"arxiv_id":"2507.07415","last_updated":"2025-07-10T04:15:44Z","snapshot_observed_at":"2026-08-06T21:44:55.808422Z","submitted_at":"2025-07-10T04:15:44Z","title":"EPIC: Efficient Prompt Interaction for Text-Image Classification","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T18:46:00.137419Z"},"links":{"citing_paper":"/paper/2507.07415"},"observation_digest":"sha256:37e19b58d2841bca1e762cae0e6d81ba838ebda2626b19d07bf77d71e3891a64","observation_id":"e14bf6c4-7ead-4b3e-97fe-5da5a5c3fc0c","resolution":{"observed_at":"2026-08-06T18:46:00.354240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:46:00.345635Z","title":"Future-aware diverse trends framework for recommendation,","venue":null,"work_id":"65c559cb-495d-4820-ad3a-e66272779b94","year":2021},"citing_paper":{"arxiv_id":"2507.07415","last_updated":"2025-07-10T04:15:44Z","snapshot_observed_at":"2026-08-06T21:44:55.808422Z","submitted_at":"2025-07-10T04:15:44Z","title":"EPIC: Efficient Prompt Interaction for Text-Image Classification","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T18:46:00.140117Z"},"links":{"citing_paper":"/paper/2507.07415"},"observation_digest":"sha256:cc33b3c31e4b1658ae3b8b7f7d0d4c0adfb852b10827ca9b1180faaa983db41d","observation_id":"33fe7a97-2abf-4ce2-99e4-f5d01c59564e","resolution":{"observed_at":"2026-08-06T18:46:00.348130Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:46:00.339658Z","title":"Dense fusion network with multimodal residual for sentiment classification,","venue":null,"work_id":"cdb2ff6c-4d36-4809-8947-65ccd48e0759","year":2021},"citing_paper":{"arxiv_id":"2507.07415","last_updated":"2025-07-10T04:15:44Z","snapshot_observed_at":"2026-08-06T21:44:55.808422Z","submitted_at":"2025-07-10T04:15:44Z","title":"EPIC: Efficient Prompt Interaction for Text-Image Classification","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T18:46:00.142283Z"},"links":{"citing_paper":"/paper/2507.07415"},"observation_digest":"sha256:faa452631f9cbf29ecc9f4231cb417f66ca20ed211a9fc927ad59fe5039f36fc","observation_id":"089606f7-3044-4917-b0a3-f1146e4545a7","resolution":{"observed_at":"2026-08-06T18:46:00.341633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.07250","last_updated":"2017-07-23T05:54:20Z","snapshot_observed_at":"2026-07-06T05:52:17.418793Z","submitted_at":"2017-07-23T05:54:20Z","title":"Tensor Fusion Network for Multimodal Sentiment Analysis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.07250","snapshot_observed_at":"2026-08-06T18:46:00.144295Z","title":"Tensor fusion network for multimodal sentiment analysis,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.07415","last_updated":"2025-07-10T04:15:44Z","snapshot_observed_at":"2026-08-06T21:44:55.808422Z","submitted_at":"2025-07-10T04:15:44Z","title":"EPIC: Efficient Prompt Interaction for Text-Image Classification","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T18:46:00.144295Z"},"links":{"cited_paper":"/paper/1707.07250","citing_paper":"/paper/2507.07415"},"observation_digest":"sha256:4bea22d92b5c75521a3b19dbc1bd3c516066eabf253d442417c1f31dc2be26da","observation_id":"34939d49-d3ad-44b8-923c-2fc5cf032d3a","resolution":{"observed_at":"2026-08-06T18:46:00.144295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:46:00.333889Z","title":"Memory fusion network for multi-view sequential learning,","venue":null,"work_id":"3ec39495-cd86-446e-9882-ab854e35c42d","year":2018},"citing_paper":{"arxiv_id":"2507.07415","last_updated":"2025-07-10T04:15:44Z","snapshot_observed_at":"2026-08-06T21:44:55.808422Z","submitted_at":"2025-07-10T04:15:44Z","title":"EPIC: Efficient Prompt Interaction for Text-Image Classification","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T18:46:00.146948Z"},"links":{"citing_paper":"/paper/2507.07415"},"observation_digest":"sha256:50e3f30522c54085eb65050282d30c6da3576b7ae19f3363a2110bbc68ef0879","observation_id":"56960134-b3a1-4bc5-b46a-bfe3b619497b","resolution":{"observed_at":"2026-08-06T18:46:00.335901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:46:00.327921Z","title":"Misa: Modality-invariant and-specific representations for multimodal sentiment analysis,","venue":null,"work_id":"4faa6398-87e3-4646-bf27-e744380bd943","year":2020},"citing_paper":{"arxiv_id":"2507.07415","last_updated":"2025-07-10T04:15:44Z","snapshot_observed_at":"2026-08-06T21:44:55.808422Z","submitted_at":"2025-07-10T04:15:44Z","title":"EPIC: Efficient Prompt Interaction for Text-Image Classification","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T18:46:00.149114Z"},"links":{"citing_paper":"/paper/2507.07415"},"observation_digest":"sha256:1588cc5a92aadf33cb0620d466985427ae88e7de01c339e99b29a0cc2363de58","observation_id":"2e0162a0-262e-4d25-897c-33e4adf5e804","resolution":{"observed_at":"2026-08-06T18:46:00.330209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:46:00.321734Z","title":"Centralnet: a multilayer approach for multimodal fusion,","venue":null,"work_id":"e914fcc9-4d50-46e3-bfc9-36ce5cc11a75","year":2018},"citing_paper":{"arxiv_id":"2507.07415","last_updated":"2025-07-10T04:15:44Z","snapshot_observed_at":"2026-08-06T21:44:55.808422Z","submitted_at":"2025-07-10T04:15:44Z","title":"EPIC: Efficient Prompt Interaction for Text-Image Classification","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T18:46:00.151389Z"},"links":{"citing_paper":"/paper/2507.07415"},"observation_digest":"sha256:a857ddbac9e505bd2655ef4542d567ee1541069bfed6002d583ad8d7113e380e","observation_id":"c7805295-3929-48e2-84b1-a43373a9f34d","resolution":{"observed_at":"2026-08-06T18:46:00.324314Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.08055","last_updated":"2022-03-15T16:50:15Z","snapshot_observed_at":"2026-08-08T01:07:16.784968Z","submitted_at":"2022-03-15T16:50:15Z","title":"Modular and Parameter-Efficient Multimodal Fusion with Prompting","version":1},"cited_work":{"arxiv_id":"2203.08055","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.08055","snapshot_observed_at":"2026-08-06T18:46:00.245075Z","title":"Modular and Parameter-Efficient Multimodal Fusion with Prompting","venue":"cs.CL","work_id":"81107fa2-ddf8-4f3a-9ea8-5207f7731e45","year":2022},"citing_paper":{"arxiv_id":"2507.07415","last_updated":"2025-07-10T04:15:44Z","snapshot_observed_at":"2026-08-06T21:44:55.808422Z","submitted_at":"2025-07-10T04:15:44Z","title":"EPIC: Efficient Prompt Interaction for Text-Image Classification","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T18:46:00.153348Z"},"links":{"cited_paper":"/paper/2203.08055","citing_paper":"/paper/2507.07415"},"observation_digest":"sha256:d03ed9d61c2fe332c79599cb9fa7a772c8cd315cb0657d4fd18b7ec8bcdbca5d","observation_id":"2830e517-deba-4ae4-b7cf-f4017f2b3250","resolution":{"observed_at":"2026-08-06T18:46:00.247864Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:46:00.315740Z","title":"Efficient multimodal fusion via interactive prompting,","venue":null,"work_id":"613e09a4-c978-4786-bc36-b0c4925abf54","year":2023},"citing_paper":{"arxiv_id":"2507.07415","last_updated":"2025-07-10T04:15:44Z","snapshot_observed_at":"2026-08-06T21:44:55.808422Z","submitted_at":"2025-07-10T04:15:44Z","title":"EPIC: Efficient Prompt Interaction for Text-Image Classification","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T18:46:00.155562Z"},"links":{"citing_paper":"/paper/2507.07415"},"observation_digest":"sha256:2e5bdc7a26a12d7f7aaa14232381dcdab54b259d1fe5a707fab61a4bde2285c1","observation_id":"eeb99690-bec2-4b27-98f8-cf993201bc0d","resolution":{"observed_at":"2026-08-06T18:46:00.317889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.02950","last_updated":"2020-11-12T03:08:28Z","snapshot_observed_at":"2026-08-10T08:27:19.772782Z","submitted_at":"2019-09-06T14:59:18Z","title":"Supervised Multimodal Bitransformers for Classifying Images and Text","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.02950","snapshot_observed_at":"2026-08-06T18:46:00.157567Z","title":"Supervised multimodal bitransformers for classifying images and text,","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2507.07415","last_updated":"2025-07-10T04:15:44Z","snapshot_observed_at":"2026-08-06T21:44:55.808422Z","submitted_at":"2025-07-10T04:15:44Z","title":"EPIC: Efficient Prompt Interaction for Text-Image Classification","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T18:46:00.157567Z"},"links":{"cited_paper":"/paper/1909.02950","citing_paper":"/paper/2507.07415"},"observation_digest":"sha256:ccd51e3ec47d0773f42094f2d8094d7cb32b9d440c068c9bd08158749df4d0c2","observation_id":"ac88227b-92e0-408c-b950-fae682fc0372","resolution":{"observed_at":"2026-08-06T18:46:00.157567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:46:00.309388Z","title":"Visual prompt tuning,","venue":null,"work_id":"dc66e89b-b460-449f-a8b6-479ad1434efe","year":2022},"citing_paper":{"arxiv_id":"2507.07415","last_updated":"2025-07-10T04:15:44Z","snapshot_observed_at":"2026-08-06T21:44:55.808422Z","submitted_at":"2025-07-10T04:15:44Z","title":"EPIC: Efficient Prompt Interaction for Text-Image Classification","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T18:46:00.159794Z"},"links":{"citing_paper":"/paper/2507.07415"},"observation_digest":"sha256:8794975dc34844d8ebcca84a7e00fcded5da2641e81b224b6e45eb2892ccdc4f","observation_id":"227179d9-8fa5-4808-8fd0-2c14be0f48ce","resolution":{"observed_at":"2026-08-06T18:46:00.311547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:46:00.302894Z","title":"Learning to prompt for vision-language models,","venue":null,"work_id":"1976291f-0bf8-4293-be23-9d95d01bd9cd","year":2022},"citing_paper":{"arxiv_id":"2507.07415","last_updated":"2025-07-10T04:15:44Z","snapshot_observed_at":"2026-08-06T21:44:55.808422Z","submitted_at":"2025-07-10T04:15:44Z","title":"EPIC: Efficient Prompt Interaction for Text-Image Classification","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T18:46:00.162217Z"},"links":{"citing_paper":"/paper/2507.07415"},"observation_digest":"sha256:e31191010aace3943f6009124463e974005c4df06a5783a042a9352f5c20b820","observation_id":"98149875-ad99-444a-ade8-d39581cb2e4f","resolution":{"observed_at":"2026-08-06T18:46:00.305386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:46:00.296753Z","title":"Con- ditional prompt learning for vision-language models,","venue":null,"work_id":"109f87cf-b5da-4711-ac89-283469cd9d10","year":2022},"citing_paper":{"arxiv_id":"2507.07415","last_updated":"2025-07-10T04:15:44Z","snapshot_observed_at":"2026-08-06T21:44:55.808422Z","submitted_at":"2025-07-10T04:15:44Z","title":"EPIC: Efficient Prompt Interaction for Text-Image Classification","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T18:46:00.164134Z"},"links":{"citing_paper":"/paper/2507.07415"},"observation_digest":"sha256:3e803497130057bc613fb4e079174a203029bdb87418c846c182bed03a32b27f","observation_id":"14a89053-f6d6-4a61-b20a-b8f1654001b3","resolution":{"observed_at":"2026-08-06T18:46:00.298928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:46:00.290018Z","title":"Maple: Multi-modal prompt learning,","venue":null,"work_id":"31465b0f-6702-4f87-8732-97ef3e4e4f32","year":2023},"citing_paper":{"arxiv_id":"2507.07415","last_updated":"2025-07-10T04:15:44Z","snapshot_observed_at":"2026-08-06T21:44:55.808422Z","submitted_at":"2025-07-10T04:15:44Z","title":"EPIC: Efficient Prompt Interaction for Text-Image Classification","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T18:46:00.166005Z"},"links":{"citing_paper":"/paper/2507.07415"},"observation_digest":"sha256:c8179baabbb9befda8dad9ff38d5fce0aacf00676b4e9e0d0d33b763659b8af2","observation_id":"ccb5fc53-3815-46af-a945-cf2dcb5f7c32","resolution":{"observed_at":"2026-08-06T18:46:00.292220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05978","last_updated":"2019-11-14T07:45:32Z","snapshot_observed_at":"2026-08-02T13:35:36.386550Z","submitted_at":"2019-11-14T07:45:32Z","title":"HUSE: Hierarchical Universal Semantic Embeddings","version":1},"cited_work":{"arxiv_id":"1911.05978","doi":null,"metadata_source":"pith","pith_arxiv_id":"1911.05978","snapshot_observed_at":"2026-08-06T18:46:00.228240Z","title":"HUSE: Hierarchical Universal Semantic Embeddings","venue":"cs.CV","work_id":"3e75a5da-ebad-4bad-aaea-d0dc9dbdb796","year":2019},"citing_paper":{"arxiv_id":"2507.07415","last_updated":"2025-07-10T04:15:44Z","snapshot_observed_at":"2026-08-06T21:44:55.808422Z","submitted_at":"2025-07-10T04:15:44Z","title":"EPIC: Efficient Prompt Interaction for Text-Image Classification","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T18:46:00.167906Z"},"links":{"cited_paper":"/paper/1911.05978","citing_paper":"/paper/2507.07415"},"observation_digest":"sha256:b9cfa69f653ce0d1b2aaa69cefd3a1fb4043b8ff4f7340b0bffbc378dd664607","observation_id":"50a382c6-55d6-4255-94f5-63a344d52c98","resolution":{"observed_at":"2026-08-06T18:46:00.232501Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.07502","last_updated":"2021-11-10T07:31:56Z","snapshot_observed_at":"2026-08-09T16:38:40.253265Z","submitted_at":"2021-07-15T17:54:36Z","title":"MultiBench: Multiscale Benchmarks for Multimodal Representation Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.07502","snapshot_observed_at":"2026-08-06T18:46:00.169992Z","title":"Multibench: Multiscale benchmarks for multimodal representation learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.07415","last_updated":"2025-07-10T04:15:44Z","snapshot_observed_at":"2026-08-06T21:44:55.808422Z","submitted_at":"2025-07-10T04:15:44Z","title":"EPIC: Efficient Prompt Interaction for Text-Image Classification","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T18:46:00.169992Z"},"links":{"cited_paper":"/paper/2107.07502","citing_paper":"/paper/2507.07415"},"observation_digest":"sha256:eab3d112f3541dc78adad3b4c6c7ee4f3ba006f2554dc5155c4c6ba4bcd3413d","observation_id":"431cd7f3-ef63-4d69-895f-ff67452f0759","resolution":{"observed_at":"2026-08-06T18:46:00.169992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:46:00.283882Z","title":"Dynamic multimodal fusion,","venue":null,"work_id":"648047d5-e9a1-4b19-b473-c77d65b22a51","year":2023},"citing_paper":{"arxiv_id":"2507.07415","last_updated":"2025-07-10T04:15:44Z","snapshot_observed_at":"2026-08-06T21:44:55.808422Z","submitted_at":"2025-07-10T04:15:44Z","title":"EPIC: Efficient Prompt Interaction for Text-Image Classification","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T18:46:00.172055Z"},"links":{"citing_paper":"/paper/2507.07415"},"observation_digest":"sha256:2e70b78f62934618ea3f9e9cb2c65fa7b5557a42696211ea67f35e3d1ce7dfc6","observation_id":"38b259c1-d15f-4dd8-94bc-3bc43a8cf9d4","resolution":{"observed_at":"2026-08-06T18:46:00.285857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:46:00.277456Z","title":"Unit: Multimodal multitask learning with a unified transformer,","venue":null,"work_id":"813c659e-cbab-473b-93c9-49474ad012bc","year":2021},"citing_paper":{"arxiv_id":"2507.07415","last_updated":"2025-07-10T04:15:44Z","snapshot_observed_at":"2026-08-06T21:44:55.808422Z","submitted_at":"2025-07-10T04:15:44Z","title":"EPIC: Efficient Prompt Interaction for Text-Image Classification","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T18:46:00.173800Z"},"links":{"citing_paper":"/paper/2507.07415"},"observation_digest":"sha256:8b82fe3a53c49e203842dead7249e3fc9c6f9c77831f34dc3b12cfdb431abf54","observation_id":"dd0298d8-4358-4f2b-a285-0749ee0c0956","resolution":{"observed_at":"2026-08-06T18:46:00.280004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:46:00.271417Z","title":"Vilt: Vision-and-language transformer without convolution or region supervision,","venue":null,"work_id":"66e744e3-6178-4605-b9e8-d9973b9ae4d5","year":2021},"citing_paper":{"arxiv_id":"2507.07415","last_updated":"2025-07-10T04:15:44Z","snapshot_observed_at":"2026-08-06T21:44:55.808422Z","submitted_at":"2025-07-10T04:15:44Z","title":"EPIC: Efficient Prompt Interaction for Text-Image Classification","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T18:46:00.175634Z"},"links":{"citing_paper":"/paper/2507.07415"},"observation_digest":"sha256:472194d6942f17e63e2342c9726ca0816a57d1154ade6cbd91f0f25fcd9d1fd5","observation_id":"52dfd6b7-6988-475a-9321-9a35ca8260a2","resolution":{"observed_at":"2026-08-06T18:46:00.273527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:46:00.264892Z","title":"Recipe recognition with large multimodal food dataset,","venue":null,"work_id":"e676eb8e-2279-4e2b-a053-5d91049131c4","year":2015},"citing_paper":{"arxiv_id":"2507.07415","last_updated":"2025-07-10T04:15:44Z","snapshot_observed_at":"2026-08-06T21:44:55.808422Z","submitted_at":"2025-07-10T04:15:44Z","title":"EPIC: Efficient Prompt Interaction for Text-Image Classification","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T18:46:00.177617Z"},"links":{"citing_paper":"/paper/2507.07415"},"observation_digest":"sha256:858ecc60bbe72bc3eaad88a327b0fdfe5cc3dd9c3065b4c6e549665de1a59dec","observation_id":"f0d32a1e-ec7f-44e2-9a7f-2c7b5cf7eef9","resolution":{"observed_at":"2026-08-06T18:46:00.267354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1702.01992","last_updated":"2017-02-07T13:05:19Z","snapshot_observed_at":"2026-08-05T13:29:33.669402Z","submitted_at":"2017-02-07T13:05:19Z","title":"Gated Multimodal Units for Information Fusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1702.01992","snapshot_observed_at":"2026-08-06T18:46:00.179567Z","title":"Gated multimodal units for information fusion,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.07415","last_updated":"2025-07-10T04:15:44Z","snapshot_observed_at":"2026-08-06T21:44:55.808422Z","submitted_at":"2025-07-10T04:15:44Z","title":"EPIC: Efficient Prompt Interaction for Text-Image Classification","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T18:46:00.179567Z"},"links":{"cited_paper":"/paper/1702.01992","citing_paper":"/paper/2507.07415"},"observation_digest":"sha256:5c720b72e15449b90bc1a4bbc1faba033646a6465a1f4b76db7b01a0ca1fb9a1","observation_id":"3b6e58a0-f577-4bed-b1c0-e0d3316eaeaf","resolution":{"observed_at":"2026-08-06T18:46:00.179567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.10582","last_updated":"2019-01-21T03:07:54Z","snapshot_observed_at":"2026-07-06T07:17:07.332183Z","submitted_at":"2018-11-26T18:37:25Z","title":"Visual Entailment Task for Visually-Grounded Language Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.10582","snapshot_observed_at":"2026-08-06T18:46:00.181739Z","title":"Visual en- tailment task for visually-grounded language learning,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.07415","last_updated":"2025-07-10T04:15:44Z","snapshot_observed_at":"2026-08-06T21:44:55.808422Z","submitted_at":"2025-07-10T04:15:44Z","title":"EPIC: Efficient Prompt Interaction for Text-Image Classification","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T18:46:00.181739Z"},"links":{"cited_paper":"/paper/1811.10582","citing_paper":"/paper/2507.07415"},"observation_digest":"sha256:7ed7062f8edd06efccc8514a64b8e34b42e3c456a67cd9bb5d85e88eb0611ec6","observation_id":"e6d8ccb1-0998-40c7-befa-b26073a20ddd","resolution":{"observed_at":"2026-08-06T18:46:00.181739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:46:00.258110Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":"7b492452-34ff-4188-a9d0-8b679976b3d0","year":2021},"citing_paper":{"arxiv_id":"2507.07415","last_updated":"2025-07-10T04:15:44Z","snapshot_observed_at":"2026-08-06T21:44:55.808422Z","submitted_at":"2025-07-10T04:15:44Z","title":"EPIC: Efficient Prompt Interaction for Text-Image Classification","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T18:46:00.183804Z"},"links":{"citing_paper":"/paper/2507.07415"},"observation_digest":"sha256:1c0cbfc635521f6963d23e46853a5a8a6715201a0ad0f3d066a0ddb81036d393","observation_id":"4d0e251c-11f0-4d21-9a81-699fac385c14","resolution":{"observed_at":"2026-08-06T18:46:00.260276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03557","last_updated":"2019-08-09T17:57:13Z","snapshot_observed_at":"2026-08-07T01:39:40.489262Z","submitted_at":"2019-08-09T17:57:13Z","title":"VisualBERT: A Simple and Performant Baseline for Vision and Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.03557","snapshot_observed_at":"2026-08-06T18:46:00.186219Z","title":"Visualbert: A simple and performant baseline for vision and language. arxiv 2019,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.07415","last_updated":"2025-07-10T04:15:44Z","snapshot_observed_at":"2026-08-06T21:44:55.808422Z","submitted_at":"2025-07-10T04:15:44Z","title":"EPIC: Efficient Prompt Interaction for Text-Image Classification","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T18:46:00.186219Z"},"links":{"cited_paper":"/paper/1908.03557","citing_paper":"/paper/2507.07415"},"observation_digest":"sha256:e53776a69bec9a6e3f27bfba67c5dcbcedc81c6592791f1e59b4341d5e311e5d","observation_id":"fe1d239f-81dd-4190-a66d-455ec0b9a538","resolution":{"observed_at":"2026-08-06T18:46:00.186219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.07415","last_updated":"2025-07-10T04:15:44Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T21:44:55.808422Z","submitted_at":"2025-07-10T04:15:44Z","title":"EPIC: Efficient Prompt Interaction for Text-Image Classification"},"reference_resolution":{"displayed":24,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":6,"verified_exact":2,"verified_fuzzy":16},"total_outbound_references":24},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 0 inbound Pith citation observations for arXiv:2507.07415."}