Pith. sign in

Paper Citation Record · LEDGER

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning

As of 9 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 1 inbound Pith citation observation for arXiv:2506.19469.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2506.19469 v1

Coverage vector

measured 44 of 44 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-06T23:12:12.857120Z

measured 45 of 45 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-08T06:32:00.761636+00:00

measured 1 of 1 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-05-10T01:20:57.490329Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-05-11T13:36:09.441352Z

Reference resolution

44 of 44 outbound references displayed

  • verified exact1
  • verified fuzzy12
  • unresolved31
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation bd697da2-b79a-442a-b65f-f0e3d050d967 · outbound

This paper cites Concepts and trends in autonomy for robot-assisted surgery,.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning Concepts and trends in autonomy for robot-assisted surgery,

Reference 1

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:12:14.173621Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T23:12:11.340298Z digest=sha256:89e0e8e7aec87db36d541cba4ae683acc3411441195e356c958dfd9e0da2a5d7

Observation cfd39512-8508-47db-8ef8-20a0cb87cf53 · outbound

This paper cites Video-instrument synergistic network for referring video instrument segmentation in robotic surgery,.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning Video-instrument synergistic network for referring video instrument segmentation in robotic surgery,

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:11.376982Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:11.376982Z digest=sha256:ead3fe1258457bc8b8c486b454da03ebb72b8ea1a3c05f76714ac8be78055d44

Observation ab67220b-0ff0-411a-9e3a-34e603e06a02 · outbound

This paper cites Surgical scene understanding in the era of foundation ai models: A comprehensive review,.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning Surgical scene understanding in the era of foundation ai models: A comprehensive review,

Reference 3

Resolution
verified exact
raw_fallback, observed 2026-08-06T23:12:13.764243Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T23:12:11.489433Z digest=sha256:5aae01e454f24040af5496b2ac6a0e452cc4cdba05e09d3a38dba8c591c70a9e

Observation 6e8a677e-16a2-4d2f-a440-12d07a17961a · outbound

This paper cites Dynamic interactive relation capturing via scene graph learning for robotic surgical report generation,.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning Dynamic interactive relation capturing via scene graph learning for robotic surgical report generation,

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:12:14.134619Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T23:12:11.593164Z digest=sha256:90bec143be8169950b66e08c267dddc8c955a1314266e7956e65d5eb7df597bd

Observation e760edad-c1b7-4f84-80bd-7371f65f92d5 · outbound

This paper cites Surgical-vqla: Trans- former with gated vision-language embedding for visual question localized-answering in robotic surgery,.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning Surgical-vqla: Trans- former with gated vision-language embedding for visual question localized-answering in robotic surgery,

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:12:14.104660Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T23:12:11.688527Z digest=sha256:c390d1e32065513df0dfe593a984ed7ac5caa8dfd51eb8183761615f164a4b27

Observation b681fea7-dda6-461b-8703-b9b884e2920c · outbound

This paper cites Cat-vil: co-attention gated vision- language embedding for visual question localized-answering in robotic surgery,.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning Cat-vil: co-attention gated vision- language embedding for visual question localized-answering in robotic surgery,

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:12:14.076170Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T23:12:11.782589Z digest=sha256:6202c29e7021d806531b063cd6a90af5f8da2414cd3cdff27473f588fa764265

Observation d6747373-95e1-489d-b022-668002a275f4 · outbound

This paper cites Enhancing visual reasoning with llm-powered knowledge graphs for visual question localized-answering in robotic surgery,.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning Enhancing visual reasoning with llm-powered knowledge graphs for visual question localized-answering in robotic surgery,

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:12:14.043677Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T23:12:11.844089Z digest=sha256:3b96f9a9482eae0df7a1335149b7f6a9d2aba326b0d659bba0fd1f9fa2471e37

Observation 29dac86e-9eab-47d5-898c-2b4ae9589523 · outbound

This paper cites GPT-4 Technical Report.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning GPT-4 Technical Report

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:11.980924Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:11.980924Z digest=sha256:1f6107ab518c4c64a6531f60811c9d10b7a841e07d76a72e63f44eeceebc1574

Observation 784c6ea1-a4cb-4e60-acf0-64322a506138 · outbound

This paper cites LLaMA: Open and Efficient Foundation Language Models.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning LLaMA: Open and Efficient Foundation Language Models

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:12.114296Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:12.114296Z digest=sha256:5df573223f2ee1fdcfa75ec338a05d486e3b05b831476f687e7c0d705aac3913

Observation 911b0418-63a3-4064-8520-d5ed2a09d0d5 · outbound

This paper cites LLM-Assisted Multi-Teacher Continual Learning for Visual Question Answering in Robotic Surgery.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning LLM-Assisted Multi-Teacher Continual Learning for Visual Question Answering in Robotic Surgery

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:12.276314Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:12.276314Z digest=sha256:b279e48dd1b24b2bec362ebf375c90700e35b2d973a5b20fc20e769cbbc78e55

Observation 7742205c-8c04-4a3b-b966-e500c0e12a92 · outbound

This paper cites Qwen Technical Report.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning Qwen Technical Report

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:12.352837Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:12.352837Z digest=sha256:0f31b63db667844c97443e8ef96956f7b9ba51b9683ed17fd44ba603caadd249

Observation 4eca0bd3-3398-41b4-a2a1-434f4c374f34 · outbound

This paper cites Otter: A multi-modal model with in-context instruction tun- ing,.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning Otter: A multi-modal model with in-context instruction tun- ing,

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:12:14.017830Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T23:12:12.483938Z digest=sha256:3269f1d1248f97c329617a680ad05b66460df680f1306683d27e44fc0ffb4c26

Observation 7d6a7c04-3975-4b2c-8d0f-bf7970b85d68 · outbound

This paper cites Surgical-LVLM: Learning to Adapt Large Vision-Language Model for Grounded Visual Question Answering in Robotic Surgery.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning Surgical-LVLM: Learning to Adapt Large Vision-Language Model for Grounded Visual Question Answering in Robotic Surgery

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:12.503145Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:12.503145Z digest=sha256:df82359d2e981b327186cf988a300e0dfffd384070a08a9adfc46996f3a1bb45

Observation 5cf0f6de-075d-481a-aa46-24909667bbcb · outbound

This paper cites EndoChat: Grounded Multimodal Large Language Model for Endoscopic Surgery.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning EndoChat: Grounded Multimodal Large Language Model for Endoscopic Surgery

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:12.627569Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:12.627569Z digest=sha256:8c0e46c6e4feccbcbe07e284928ca31e6bbec4e3eb3905562e7269a1112b7985

Observation 163e1094-d61a-4214-b2e8-7daf56552e77 · outbound

This paper cites A Survey on Hallucination in Large Vision-Language Models.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning A Survey on Hallucination in Large Vision-Language Models

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:12.655869Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:12.655869Z digest=sha256:7ff98affaa21bc448efd09ce088bb16fc1f7b38889d830904ce8e0e2bc1ff4e3

Observation 95a736b1-c5fa-41f9-a2f3-36bc164ccf8e · outbound

This paper cites OpenAI o1 System Card.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning OpenAI o1 System Card

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:12.661327Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:12.661327Z digest=sha256:9f85efa20a3488bd5af2dd45a966b52f906773883ae28a1450891778a8ec9246

Observation edabc439-2543-4743-b1a0-17d8b09e2f00 · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:12.668699Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:12.668699Z digest=sha256:4ede9d1837ec1af2a284699a0d87e883d4fed522d53ba8cbfba5e10790a23cf7

Observation 9984e66c-a7c6-402c-8922-84dea3f6083e · outbound

This paper cites Scaling of Search and Learning: A Roadmap to Reproduce o1 from Reinforcement Learning Perspective.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning Scaling of Search and Learning: A Roadmap to Reproduce o1 from Reinforcement Learning Perspective

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:12.674901Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:12.674901Z digest=sha256:b149bd4cc555dc36e37fcccc9a063a7d2643122f2e8a2ddd9c77170f45e17358

Observation ecbf9516-801e-4646-90d2-b0560d9acc53 · outbound

This paper cites Automatic Chain of Thought Prompting in Large Language Models.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning Automatic Chain of Thought Prompting in Large Language Models

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:12.682873Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:12.682873Z digest=sha256:6b7875a94c8f9f3147edd84351d52e3c1698fe14850fa16ed50db9819718d2ac

Observation 6a9393af-ed01-4f5b-b4d7-83a19c9309e6 · outbound

This paper cites LMM-R1: Empowering 3B LMMs with Strong Reasoning Abilities Through Two-Stage Rule-Based RL.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning LMM-R1: Empowering 3B LMMs with Strong Reasoning Abilities Through Two-Stage Rule-Based RL

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:12.688769Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:12.688769Z digest=sha256:e08546a336512ccb44d351b828c321c32bfc60cac2979e505272375b2ec21eab

Observation 11926f27-4162-4895-8f2b-c855a4d22f50 · outbound

This paper cites Vision-R1: Evolving Human-Free Alignment in Large Vision-Language Models via Vision-Guided Reinforcement Learning.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning Vision-R1: Evolving Human-Free Alignment in Large Vision-Language Models via Vision-Guided Reinforcement Learning

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:12.695884Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:12.695884Z digest=sha256:78dd9f5be0119110fc52acb242cf8a543710e2b33c096db78f498f8f5c7a8633

Observation 14e73cbf-1563-4072-b7dd-1fb2720c3fb2 · outbound

This paper cites Video-R1: Reinforcing Video Reasoning in MLLMs.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning Video-R1: Reinforcing Video Reasoning in MLLMs

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:12.708747Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:12.708747Z digest=sha256:ac9165b2aaf84aaa0dab3f30d5f85abc66f4a98866cd9716def2ee6d5b00ad5b

Observation 1378fa37-0922-4fe9-bf05-d13e38584077 · outbound

This paper cites Med-r1: Reinforcement learning for generalizable medical reasoning in vision-language models,.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning Med-r1: Reinforcement learning for generalizable medical reasoning in vision-language models,

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:12.715293Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:12.715293Z digest=sha256:a541450e5140cdaca2a4f0317ef2479d053be6d644427d846b9b395630c8f648

Observation 427df6e0-825a-431b-9410-84e29b6a4a42 · outbound

This paper cites HuatuoGPT-o1, Towards Medical Complex Reasoning with LLMs.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning HuatuoGPT-o1, Towards Medical Complex Reasoning with LLMs

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:12.721082Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:12.721082Z digest=sha256:1f0aebda8bbc2cf4c3e69ad9891cd4a4a06e7a61e3804c19280c227b6589bd64

Observation cc933ffa-6545-4645-ae21-a3a1bff3e0ed · outbound

This paper cites How Abilities in Large Language Models are Affected by Supervised Fine-tuning Data Composition.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning How Abilities in Large Language Models are Affected by Supervised Fine-tuning Data Composition

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:12.727040Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:12.727040Z digest=sha256:e5bddeef51ca6fc19b16d267363f4d5bcd90467c8694380adf83032210d62270

Observation 9a515ed5-d779-42ea-908a-6b772492f5c1 · outbound

This paper cites DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:12.732788Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:12.732788Z digest=sha256:9cab563df33b3365d267a4288ea678e6b1aa13711e28700ed4d35829f35d5595

Observation 9a80e5d9-411f-4fdd-8c1a-0c49d5ae2f18 · outbound

This paper cites Aligning Large Multimodal Models with Factually Augmented RLHF.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning Aligning Large Multimodal Models with Factually Augmented RLHF

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:12.739097Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:12.739097Z digest=sha256:ca03e8ac615c9a60a697a07b1d4aa3993db2bd39e345cb368ecbdf26b3deba55

Observation c5d0ac4f-3bda-4696-bd88-3e959df2a637 · outbound

This paper cites Direct preference optimization: Your language model is secretly a reward model,.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning Direct preference optimization: Your language model is secretly a reward model,

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:12.745011Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:12.745011Z digest=sha256:51486191da48265be65ef66c845156715a336db39e76d83216b9b75caaff680f

Observation 1cb6f7bd-1dfe-4715-881b-fbe525c78b9a · outbound

This paper cites SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:12.750753Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:12.750753Z digest=sha256:6bd90b05062ec73a8ba76543092316587077ddc4ca7228fad7bca39cd76a3dd0

Observation 364724d7-0984-4df3-9e81-5a3c1ade3d92 · outbound

This paper cites Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:12.756251Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:12.756251Z digest=sha256:8ec4d15a5d61f725fe4cdc4739aee6286bdfcce0b1e39ad015a84446d14591d8

Observation 05c073c1-fc3b-49ff-bc03-159e8a3a529f · outbound

This paper cites Langloc: Language-driven localization via formatted spatial description genera- tion,.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning Langloc: Language-driven localization via formatted spatial description genera- tion,

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:12:13.980112Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T23:12:12.761595Z digest=sha256:7714719f39c4fdc7942564b103d9f045c0bf8d11b24fa720c8e33e4a17a84523

Observation f5101bf7-41c8-4e75-9dd1-4178d6f09b16 · outbound

This paper cites Qwen2.5-VL Technical Report.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning Qwen2.5-VL Technical Report

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:12.768154Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:12.768154Z digest=sha256:484bc6056939f81e3b1adcb6091ae0b19938d974257d545d77a9feafa524133f

Observation 4352587b-6c54-497e-849a-5a90884d80bb · outbound

This paper cites Surgical-vqa: Visual question answering in surgical scenes using transformer,.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning Surgical-vqa: Visual question answering in surgical scenes using transformer,

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:12:13.922312Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T23:12:12.779282Z digest=sha256:2f8918d4d9a197943b04744b6d134a9e933cf07c1e5a0c1b6fbbd6fc4cded5c0

Observation dbc56a84-e3da-4f42-b0f6-cc6eef8646df · outbound

This paper cites Beyond bilinear: Generalized multimodal factorized high-order pooling for visual question answering,.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning Beyond bilinear: Generalized multimodal factorized high-order pooling for visual question answering,

Reference 35

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:12:13.895806Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T23:12:12.784644Z digest=sha256:9824aa87f8c4ca0bf2905d75ea7e8fe505deb108b922a776a6ea7cd739edb1ae

Observation 7c35949f-2a47-494d-85cf-98290fc3d337 · outbound

This paper cites Block: Bilinear superdiagonal fusion for visual question answering and visual relation- ship detection,.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning Block: Bilinear superdiagonal fusion for visual question answering and visual relation- ship detection,

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:12:13.872822Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T23:12:12.791470Z digest=sha256:6254a23a3081a4bb3833c64897f497c582ff0f4af88b2e9fd8db4ff5fa8efa39

Observation fb416d27-3a48-4e2d-ac3e-5d2fd8e00d98 · outbound

This paper cites Mutan: Multi- modal tucker fusion for visual question answering,.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning Mutan: Multi- modal tucker fusion for visual question answering,

Reference 37

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:12:13.854178Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T23:12:12.798619Z digest=sha256:28227a5115c179e450efd329fd8b8c47fa064bb12ee00a19c85fe86dda081de2

Observation 64124cf8-9188-46a3-8933-19be1b1d7bec · outbound

This paper cites Surgicalgpt: end- to-end language-vision gpt for visual question answering in surgery,.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning Surgicalgpt: end- to-end language-vision gpt for visual question answering in surgery,

Reference 38

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:12:13.832918Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T23:12:12.807977Z digest=sha256:94b208fa33e0523d4e561fb6f407de4ae50992ef8735e66bbb28ff86723dbcb0

Observation 464c2954-80a4-47f8-b714-e862ca54a132 · outbound

This paper cites 2018 Robotic Scene Segmentation Challenge.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning 2018 Robotic Scene Segmentation Challenge

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:12.816231Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:12.816231Z digest=sha256:b339f29333799eba7dd9e3bd7fa4dd9136727f14c4f495da8b23b125fdc37d5a

Observation 30b3032c-54da-4f24-9c6c-e35bcac52831 · outbound

This paper cites 2017 Robotic Instrument Segmentation Challenge.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning 2017 Robotic Instrument Segmentation Challenge

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:12.826059Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:12.826059Z digest=sha256:72e251d69b0e301f589d90a39ecee16bf9a5cf6463f66eadf701cb982acc110b

Observation ada20978-0cb4-447c-8932-df36c11596fe · outbound

This paper cites A review on evaluation metrics for data classification evaluations,.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning A review on evaluation metrics for data classification evaluations,

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:12.832743Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:12.832743Z digest=sha256:0024d2da6b836592105db9a78a5737d308e2245857f2814936889a29d06c38cd

Observation 6470ce9e-7fcf-41e3-a7e1-6d99c2e56055 · outbound

This paper cites Generalized intersection over union: A metric and a loss for bounding box regression,.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning Generalized intersection over union: A metric and a loss for bounding box regression,

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:12.838951Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:12.838951Z digest=sha256:5fe19fbe3f451678c2e35f19e81c06c287d878e2f1535411aa25abc3bd2059ce

Observation ad8bc998-1407-4e1c-b31a-b1a81205c427 · outbound

This paper cites Visual instruction tuning,.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning Visual instruction tuning,

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:12.845636Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:12.845636Z digest=sha256:1e61493a33b8d8861b1a4b2449ec981a704b8748d691063d084fe61536bc71fc

Observation 94b649a3-3737-4dbc-8bd3-1c8d53c93269 · outbound

This paper cites Llava-med: Training a large language-and-vision assistant for biomedicine in one day,.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning Llava-med: Training a large language-and-vision assistant for biomedicine in one day,

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:12.850954Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:12.850954Z digest=sha256:03e58abc73dd9e718391aad0a2d65ded6ebd79cc8223cabf0730e0f145d6cbf9

Observation c18551c6-e599-4abc-8a1d-48fd6edc248a · outbound

This paper cites Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:12.857120Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:12.857120Z digest=sha256:9ce5cf6254cc3e4c698f0e7c81567fc99a1fa5763962a1e5c3c8e642cf506afe

Pith citing papers

Observation a0d79053-ef30-4d96-8b51-effcfd95991b · inbound

SurgCoT: Advancing Spatiotemporal Reasoning in Surgical Videos through a Chain-of-Thought Benchmark cites this paper.

SurgCoT: Advancing Spatiotemporal Reasoning in Surgical Videos through a Chain-of-Thought Benchmark Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning

Reference 14

Resolution
verified exact
arxiv_id, observed 2026-05-11T13:36:09.445468Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-05-10T01:20:57.490329Z digest=sha256:a4361350f25b74ed42443805f1c264a87e4f63c12a249a70761eb3a46a094105