Pith. sign in

Paper Citation Record · LEDGER

Vision Language Transformers: A Survey

As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 5 inbound Pith citation observations for arXiv:2307.03254.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2307.03254 v1

Coverage vector

measured 0 of 0 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links

measured 5 of 5 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-10T06:31:04.303077+00:00

measured 5 of 5 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-08T22:40:35.429337Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-05-18T13:02:37.471310Z

Reference resolution

0 of 0 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved0
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

No outbound reference observations are available for this paper version.

Pith citing papers

Observation ed68c5a7-568f-44ec-b3be-3fb277cb0ae5 · inbound

Ask and Remember: A Questions-Only Replay Strategy for Continual Visual Question Answering cites this paper.

Ask and Remember: A Questions-Only Replay Strategy for Continual Visual Question Answering Vision Language Transformers: A Survey

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-08T22:40:35.429337Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T22:40:35.429337Z digest=sha256:03f7889d1f1a367166ea91247ee56073d533b290c6f6dff3e65cb3e1f053edf0

Observation 72d72370-4533-424f-9050-1f27c501232b · inbound

Multilingual Vision-Language Models, A Survey cites this paper.

Multilingual Vision-Language Models, A Survey Vision Language Transformers: A Survey

Reference 50

Resolution
malformed identifier
arxiv_id, observed 2026-05-18T13:02:37.474032Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-18T13:02:08.000814Z digest=sha256:5aa03b6c49c212fa3769533e8117c08886d030c170e118a637202663a445dfc0

Observation 486247f0-021d-4b8b-b231-2dd98c030d3e · inbound

ESsEN: Training Compact Discriminative Vision-Language Transformers in a Low-Resource Setting cites this paper.

ESsEN: Training Compact Discriminative Vision-Language Transformers in a Low-Resource Setting Vision Language Transformers: A Survey

Reference 24

Resolution
verified exact
arxiv_id, observed 2026-05-11T11:56:19.926014Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=arxiv_source observed=2026-05-10T04:28:38.775948Z digest=sha256:7d08e3ad8552fe12443f5c5e9663287c5276e9c15e7d98adbbb37ebd64061692

Observation fa4adf7e-2cfc-4bb9-b800-8d4e0da84b34 · inbound

VIDA: A dataset for Visually Dependent Ambiguity in Multimodal Machine Translation cites this paper.

VIDA: A dataset for Visually Dependent Ambiguity in Multimodal Machine Translation Vision Language Transformers: A Survey

Reference 95

Resolution
verified exact
arxiv_id, observed 2026-05-09T05:50:25.700280Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=arxiv_source observed=2026-05-08T19:34:02.860270Z digest=sha256:a4ddec509f186bcf8061d808c7d074ec7295f93f696894f3a79518e5ac28c3ba

Observation 527b9962-46b4-42be-8b4d-b17928304686 · inbound

Edge Deep Learning in Computer Vision and Medical Diagnostics: A Comprehensive Survey cites this paper.

Edge Deep Learning in Computer Vision and Medical Diagnostics: A Comprehensive Survey Vision Language Transformers: A Survey

Reference 85

Resolution
verified exact
arxiv_id, observed 2026-05-11T04:30:55.738401Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=arxiv_source observed=2026-05-11T01:19:51.418374Z digest=sha256:6a3e8d73ce10522a5d86532cffae84bfe44acdbf7cb7b5c49aeefa19ebd5905b