Pith. sign in

Paper Citation Record · LEDGER

Question-Agnostic Attention for Visual Question Answering

As of 16 August 2026, this Paper Citation Record lists 26 of 26 outbound references and 0 inbound Pith citation observations for arXiv:1908.03289.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
1908.03289 v2

Coverage vector

measured 26 of 26 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-14T14:22:44.533980Z

measured 26 of 26 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-16T06:30:59.297886+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

26 of 26 outbound references displayed

  • verified exact0
  • verified fuzzy16
  • unresolved10
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 47c493d0-6c15-4e69-998c-84e2633fb546 · outbound

This paper cites Block: Bilinear Superdiagonal Fusion for Visual Question Answering and Visual Rela- tionship Detection,.

Question-Agnostic Attention for Visual Question Answering Block: Bilinear Superdiagonal Fusion for Visual Question Answering and Visual Rela- tionship Detection,

Reference 1

Resolution
verified fuzzy
raw_fallback, observed 2026-08-14T14:22:44.919349Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-14T14:22:44.413094Z digest=sha256:aeb98bb29487b1361f731904410ba1939b42027868eba2b41de58e2206f54977

Observation 8e86f382-2e26-4705-8bcb-d70441bd0cd7 · outbound

This paper cites Vqa: Visual question answering,.

Question-Agnostic Attention for Visual Question Answering Vqa: Visual question answering,

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-08-14T14:22:44.903435Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-14T14:22:44.418613Z digest=sha256:f9af9df1cbfe5ddb04a1b6d8e1d6dc54f0272035cfef9b92b898b31e7ebd3f32

Observation c0fb161a-f99e-4715-a5b9-2002e84523d2 · outbound

This paper cites Multimodal Compact Bilinear Pooling for Visual Question Answering and Visual Grounding.

Question-Agnostic Attention for Visual Question Answering Multimodal Compact Bilinear Pooling for Visual Question Answering and Visual Grounding

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-14T14:22:44.423711Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-14T14:22:44.423711Z digest=sha256:d8f1797352d8f49a8ab06f357f53b1bcc3baf413c35a6d6ef0b86170dd18650a

Observation 736b6f5d-db2f-45b7-be16-3525e7ffb9ce · outbound

This paper cites Stacked attention networks for image question answering,.

Question-Agnostic Attention for Visual Question Answering Stacked attention networks for image question answering,

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-14T14:22:44.429142Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-14T14:22:44.429142Z digest=sha256:4186b9e4ca20b5874dd7897b023e121c2e2e161e389d9b61cbeaceff0e14fc69

Observation cb3c2835-e211-45e3-8c2d-8e860f536b56 · outbound

This paper cites Bottom-up and top-down attention for image captioning and visual question answering,.

Question-Agnostic Attention for Visual Question Answering Bottom-up and top-down attention for image captioning and visual question answering,

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-14T14:22:44.434232Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-14T14:22:44.434232Z digest=sha256:ba35e082a36514bc76ca16909065270d97108f650419f1a0ef14a70ed61dc4de

Observation 7c303ddd-4764-46b6-a2ba-f566aa5c0556 · outbound

This paper cites Reciprocal attention fusion for visual question answering,.

Question-Agnostic Attention for Visual Question Answering Reciprocal attention fusion for visual question answering,

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-14T14:22:44.867166Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-14T14:22:44.439147Z digest=sha256:389c44cf3755eb4b7c4e4aca8ea53d0f5e9286a97661fa9cfb9a737046a9f74c

Observation 17841461-4a65-44d8-ba19-047c8d9b01b6 · outbound

This paper cites Co-attending free-form regions and detections with multi-modal multiplicative feature embed- ding for visual question answering,.

Question-Agnostic Attention for Visual Question Answering Co-attending free-form regions and detections with multi-modal multiplicative feature embed- ding for visual question answering,

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-08-14T14:22:44.851711Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-14T14:22:44.444383Z digest=sha256:f104b17ac09c38a15f2c248e179bdd8e173d259d6ed87145cc466464f8e12ba4

Observation e1ad8158-dc11-421d-ad7c-9db1e323beaf · outbound

This paper cites Mutan: Multi- modal tucker fusion for visual question answering,.

Question-Agnostic Attention for Visual Question Answering Mutan: Multi- modal tucker fusion for visual question answering,

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-08-14T14:22:44.835768Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-14T14:22:44.449093Z digest=sha256:80e768841ffb00ad12c29aad634ca9712461be1b020cafcefbe4d78a69eb8ff8

Observation 9ef19cd6-219b-4157-b563-7a2f184ed6f4 · outbound

This paper cites Hierarchical question-image co-attention for visual question answering,.

Question-Agnostic Attention for Visual Question Answering Hierarchical question-image co-attention for visual question answering,

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-08-14T14:22:44.819995Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-14T14:22:44.453878Z digest=sha256:5781100ffd8ab112a81aef1b8c44736f68fcea13287ef54be37785207baa83de

Observation 2367e106-1b82-4e6c-afb6-0270772732fd · outbound

This paper cites From known to the unknown: Transferring knowledge to answer questions about novel visual and semantic concepts,.

Question-Agnostic Attention for Visual Question Answering From known to the unknown: Transferring knowledge to answer questions about novel visual and semantic concepts,

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-08-14T14:22:44.801910Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-14T14:22:44.458840Z digest=sha256:767b4dc5967fca26ef09df8a7ccd5b25980d314f39a5d60adf756c0d07373b5e

Observation bae4e041-29d4-42e4-ab24-b42b3d02a4c1 · outbound

This paper cites Deep residual learning for image recognition,.

Question-Agnostic Attention for Visual Question Answering Deep residual learning for image recognition,

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-14T14:22:44.463309Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-14T14:22:44.463309Z digest=sha256:3b2f7bcab2436acfa50fcf539aa687640200a26859858b60df3af5852857764b

Observation 9c59022a-3daa-4596-abb2-b01b21915148 · outbound

This paper cites Faster r-cnn: Towards real-time object detection with region proposal networks,.

Question-Agnostic Attention for Visual Question Answering Faster r-cnn: Towards real-time object detection with region proposal networks,

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-14T14:22:44.467812Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-14T14:22:44.467812Z digest=sha256:b6f7993cc58df96668e013cc95b7234fc7f202334a038f49511e44afa361bc14

Observation dc960ddd-e561-42c9-a403-e10c34e0b435 · outbound

This paper cites Learning to count objects in natural images for visual question answering,.

Question-Agnostic Attention for Visual Question Answering Learning to count objects in natural images for visual question answering,

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-14T14:22:44.767736Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-14T14:22:44.472585Z digest=sha256:92d6c1c7f99f5be06044619f5f5b98f92871a99db0fc68bbe9eea9874c4d3ae3

Observation a573dd06-2643-4640-b59f-e6008ae38b8f · outbound

This paper cites Where to look: Focus regions for visual question answering,.

Question-Agnostic Attention for Visual Question Answering Where to look: Focus regions for visual question answering,

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-14T14:22:44.753045Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-14T14:22:44.477125Z digest=sha256:6df1241113bd84180830c73ba499dfd5c9b25f9e2101073453186432864e70af

Observation c647c78d-3153-48ef-91c4-9f918ed22394 · outbound

This paper cites Human attention in visual question answering: Do humans and deep networks look at the same regions?.

Question-Agnostic Attention for Visual Question Answering Human attention in visual question answering: Do humans and deep networks look at the same regions?

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-14T14:22:44.738023Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-14T14:22:44.481693Z digest=sha256:4de2161edc2f696ca2a716fef33131f01e2a3f91c9116bb188ae02de96c8b7dd

Observation 1e7adb88-2a0f-4503-bd06-757337bb2dec · outbound

This paper cites Learning to predict where humans look,.

Question-Agnostic Attention for Visual Question Answering Learning to predict where humans look,

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-14T14:22:44.721801Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-14T14:22:44.486444Z digest=sha256:f4b4bb372de7d628cee64803b3e561a4183af28fcc2b87f2475a5f854383a409

Observation 02e8b8dd-72c5-409b-9008-15eebadaf66e · outbound

This paper cites Imagenet: A large-scale hierarchical image database,.

Question-Agnostic Attention for Visual Question Answering Imagenet: A large-scale hierarchical image database,

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-14T14:22:44.491380Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-14T14:22:44.491380Z digest=sha256:8b1123b0b0867c35132c1d23c6b6cba80f499dc600ccf86c4a708c65fc5030ce

Observation 4c75e972-52ae-48f3-9af1-c364c45f2b3a · outbound

This paper cites Glove: Global vectors for word representation,.

Question-Agnostic Attention for Visual Question Answering Glove: Global vectors for word representation,

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-14T14:22:44.496591Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-14T14:22:44.496591Z digest=sha256:91619411b8a055e769cbe36d495c7174c461170ca07168acee5f7513b29a02a7

Observation 60e3aa4f-8069-455d-afd3-d1472d3db324 · outbound

This paper cites Skip-thought vectors,.

Question-Agnostic Attention for Visual Question Answering Skip-thought vectors,

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-14T14:22:44.687279Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-14T14:22:44.501336Z digest=sha256:719572ef6bc2eb563617e17a2164e462cb9c9ff62d4007493f040e46a43e70f8

Observation cd9c8b41-44ce-43fe-b66d-518a0c8ed28d · outbound

This paper cites Making the v in vqa matter: Elevating the role of image understanding in visual question answering,.

Question-Agnostic Attention for Visual Question Answering Making the v in vqa matter: Elevating the role of image understanding in visual question answering,

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-08-14T14:22:44.672563Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-14T14:22:44.505959Z digest=sha256:cfb8df54c2742bb936ae40629ba4667b4e0a3c0a2810930a10a37d0c72e4192d

Observation abe71735-c3c3-4dc6-bf45-ad43e6f3641c · outbound

This paper cites Microsoft coco: Common objects in context,.

Question-Agnostic Attention for Visual Question Answering Microsoft coco: Common objects in context,

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-14T14:22:44.510738Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-14T14:22:44.510738Z digest=sha256:4f77c8c00ef07cc4870df0dce1b35a3f29626ccf1a62d1033f3c6dcb64b4ee26

Observation 970d208f-f64b-415e-8881-ca0986a43e2a · outbound

This paper cites An analysis of visual question answering algorithms,.

Question-Agnostic Attention for Visual Question Answering An analysis of visual question answering algorithms,

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-08-14T14:22:44.647382Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-14T14:22:44.515249Z digest=sha256:05cebc17f15fcce042b8fafc42c218b29fc022de7c99a122d4cb6ca2f5e87d40

Observation b981af2b-7c2d-45c0-a924-f859149ec356 · outbound

This paper cites Mask r-cnn,.

Question-Agnostic Attention for Visual Question Answering Mask r-cnn,

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-14T14:22:44.520068Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-14T14:22:44.520068Z digest=sha256:fd56c0a778d6b559006acda95bc23b94bd6e88d122df6a42317565050cd04f8a

Observation 1d032b3f-d186-4bcc-a3fc-99a724c87178 · outbound

This paper cites Beyond bilinear: Generalized multimodal factorized high-order pooling for visual question answering,.

Question-Agnostic Attention for Visual Question Answering Beyond bilinear: Generalized multimodal factorized high-order pooling for visual question answering,

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-08-14T14:22:44.621310Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-14T14:22:44.524730Z digest=sha256:65adbacb795ddcdb32beb89b19a63227e2146c568aabafc30f912f510413a374

Observation b9b87779-5061-46c9-93e2-d4400070b731 · outbound

This paper cites Neural module networks,.

Question-Agnostic Attention for Visual Question Answering Neural module networks,

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-14T14:22:44.604528Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-14T14:22:44.529554Z digest=sha256:44152ae01d42a8671c3f893c5e17c9c553aef6e27e60c4f5c0875c40b32a4b33

Observation a88bf7d5-96d7-4a68-bee0-5934215e4b5a · outbound

This paper cites Training Recurrent Answering Units with Joint Loss Minimization for VQA.

Question-Agnostic Attention for Visual Question Answering Training Recurrent Answering Units with Joint Loss Minimization for VQA

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-14T14:22:44.533980Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-14T14:22:44.533980Z digest=sha256:877d53597141c5bc5782cef2d0366d128e8cb728567e1832ebf37e9d65100ee6

Pith citing papers

No inbound Pith citation observations are available.