Pith. sign in

Paper Citation Record · LEDGER

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning

As of 20 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 1 inbound Pith citation observation for arXiv:2506.19469.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2506.19469 v1

Coverage vector

measured 44 of 44 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-06T23:12:12.857120Z

measured 45 of 45 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-19T06:32:44.657259+00:00

measured 1 of 1 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-05-10T01:20:57.490329Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-05-11T13:36:09.441352Z

Reference resolution

44 of 44 outbound references displayed

  • verified exact1
  • verified fuzzy12
  • unresolved31
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation bd697da2-b79a-442a-b65f-f0e3d050d967 · outbound

This paper cites Concepts and trends in autonomy for robot-assisted surgery,.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning Concepts and trends in autonomy for robot-assisted surgery,

Reference 1

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:12:14.173621Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T23:12:11.340298Z digest=sha256:7dbde4d9b60b1e95660a3ec7392bbf34cebe10c9a4edea57b96a2567ecf9456a

Observation cfd39512-8508-47db-8ef8-20a0cb87cf53 · outbound

This paper cites Video-instrument synergistic network for referring video instrument segmentation in robotic surgery,.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning Video-instrument synergistic network for referring video instrument segmentation in robotic surgery,

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:11.376982Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:11.376982Z digest=sha256:dce4cfe0e3bbf555d22e0e3f1ea80b8435517f58cd8a822ce9281651e94ad69c

Observation ab67220b-0ff0-411a-9e3a-34e603e06a02 · outbound

This paper cites Surgical scene understanding in the era of foundation ai models: A comprehensive review,.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning Surgical scene understanding in the era of foundation ai models: A comprehensive review,

Reference 3

Resolution
verified exact
raw_fallback, observed 2026-08-06T23:12:13.764243Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T23:12:11.489433Z digest=sha256:5172803585176b7835f164e961b4c12c2af35f2d085f282be7d099a56b83e0f8

Observation 6e8a677e-16a2-4d2f-a440-12d07a17961a · outbound

This paper cites Dynamic interactive relation capturing via scene graph learning for robotic surgical report generation,.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning Dynamic interactive relation capturing via scene graph learning for robotic surgical report generation,

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:12:14.134619Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T23:12:11.593164Z digest=sha256:8830b9b522848f7694d1d79ef2c6f654668ca6a3ddc336feacd114da99eccecd

Observation e760edad-c1b7-4f84-80bd-7371f65f92d5 · outbound

This paper cites Surgical-vqla: Trans- former with gated vision-language embedding for visual question localized-answering in robotic surgery,.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning Surgical-vqla: Trans- former with gated vision-language embedding for visual question localized-answering in robotic surgery,

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:12:14.104660Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T23:12:11.688527Z digest=sha256:87544668723619aa1c2b38bda3541bb54b4ad98b5cc9331565e0d5d94b9afa93

Observation b681fea7-dda6-461b-8703-b9b884e2920c · outbound

This paper cites Cat-vil: co-attention gated vision- language embedding for visual question localized-answering in robotic surgery,.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning Cat-vil: co-attention gated vision- language embedding for visual question localized-answering in robotic surgery,

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:12:14.076170Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T23:12:11.782589Z digest=sha256:1a9099bce1edbc01ee515b722556682b646b906b25b0156e4338c9fd77dd46f8

Observation d6747373-95e1-489d-b022-668002a275f4 · outbound

This paper cites Enhancing visual reasoning with llm-powered knowledge graphs for visual question localized-answering in robotic surgery,.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning Enhancing visual reasoning with llm-powered knowledge graphs for visual question localized-answering in robotic surgery,

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:12:14.043677Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T23:12:11.844089Z digest=sha256:8c6c2a9c0e7de3946d1f9ade84634f6ab66389af52eb496327f4a442d08d842e

Observation 29dac86e-9eab-47d5-898c-2b4ae9589523 · outbound

This paper cites GPT-4 Technical Report.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning GPT-4 Technical Report

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:11.980924Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:11.980924Z digest=sha256:4c7e693ab4cd3cad4fe8c014dc136ee94e11813672a1dcb2444be359cb05e680

Observation 784c6ea1-a4cb-4e60-acf0-64322a506138 · outbound

This paper cites LLaMA: Open and Efficient Foundation Language Models.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning LLaMA: Open and Efficient Foundation Language Models

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:12.114296Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:12.114296Z digest=sha256:7ae9994b771745c0f3d5050d24db8eb9df869d82b229ac3523060032ab2ef06f

Observation 911b0418-63a3-4064-8520-d5ed2a09d0d5 · outbound

This paper cites LLM-Assisted Multi-Teacher Continual Learning for Visual Question Answering in Robotic Surgery.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning LLM-Assisted Multi-Teacher Continual Learning for Visual Question Answering in Robotic Surgery

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:12.276314Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:12.276314Z digest=sha256:de61a6ad68947c19f9b7e2f5faeaed099188e09ec57a6c1572a4bb3678fadf57

Observation 7742205c-8c04-4a3b-b966-e500c0e12a92 · outbound

This paper cites Qwen Technical Report.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning Qwen Technical Report

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:12.352837Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:12.352837Z digest=sha256:eaa322a7eb6c03a22c5d05172ba1a59c90cc99777dfd4edae4dda5bf2baf056c

Observation 4eca0bd3-3398-41b4-a2a1-434f4c374f34 · outbound

This paper cites Otter: A multi-modal model with in-context instruction tun- ing,.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning Otter: A multi-modal model with in-context instruction tun- ing,

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:12:14.017830Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T23:12:12.483938Z digest=sha256:e9168b8d49ecd8010fd034efd59d7c88e99b22926d50e0952f7be6f3f6de7b01

Observation 7d6a7c04-3975-4b2c-8d0f-bf7970b85d68 · outbound

This paper cites Surgical-LVLM: Learning to Adapt Large Vision-Language Model for Grounded Visual Question Answering in Robotic Surgery.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning Surgical-LVLM: Learning to Adapt Large Vision-Language Model for Grounded Visual Question Answering in Robotic Surgery

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:12.503145Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:12.503145Z digest=sha256:eebccef2aa974705c5ad2534b87d1dda1c11e88b435a45eced49254c811ec7b1

Observation 5cf0f6de-075d-481a-aa46-24909667bbcb · outbound

This paper cites EndoChat: Grounded Multimodal Large Language Model for Endoscopic Surgery.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning EndoChat: Grounded Multimodal Large Language Model for Endoscopic Surgery

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:12.627569Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:12.627569Z digest=sha256:84864bffc6599ffa3c708a4aa8659a150e42935bdd850434af842284b2b87b58

Observation 163e1094-d61a-4214-b2e8-7daf56552e77 · outbound

This paper cites A Survey on Hallucination in Large Vision-Language Models.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning A Survey on Hallucination in Large Vision-Language Models

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:12.655869Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:12.655869Z digest=sha256:1afd9095ed12e3406b86e2210318efbccfec31338363863ed4ef3e70a3519546

Observation 95a736b1-c5fa-41f9-a2f3-36bc164ccf8e · outbound

This paper cites OpenAI o1 System Card.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning OpenAI o1 System Card

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:12.661327Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:12.661327Z digest=sha256:ad072b3c68046f74e93e0c912963b7536d50622005bebbea93e3000a914e0415

Observation edabc439-2543-4743-b1a0-17d8b09e2f00 · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:12.668699Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:12.668699Z digest=sha256:2d3971442220e738e2471e3e81a8c6ed5686e932c18f4340b912a46700eddbbc

Observation 9984e66c-a7c6-402c-8922-84dea3f6083e · outbound

This paper cites Scaling of Search and Learning: A Roadmap to Reproduce o1 from Reinforcement Learning Perspective.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning Scaling of Search and Learning: A Roadmap to Reproduce o1 from Reinforcement Learning Perspective

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:12.674901Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:12.674901Z digest=sha256:fd641690f2ff32550cb8bfb296b1efbf0e2964a8085ce1898eea69eba912d345

Observation ecbf9516-801e-4646-90d2-b0560d9acc53 · outbound

This paper cites Automatic Chain of Thought Prompting in Large Language Models.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning Automatic Chain of Thought Prompting in Large Language Models

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:12.682873Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:12.682873Z digest=sha256:9312d25192b7d4203535cc44496b0f4c0b9e78fa4e77f510b4be50b446c650d0

Observation 6a9393af-ed01-4f5b-b4d7-83a19c9309e6 · outbound

This paper cites LMM-R1: Empowering 3B LMMs with Strong Reasoning Abilities Through Two-Stage Rule-Based RL.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning LMM-R1: Empowering 3B LMMs with Strong Reasoning Abilities Through Two-Stage Rule-Based RL

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:12.688769Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:12.688769Z digest=sha256:bd789b2cefec99afcfce6cf403c5e42c4546a8c13bcc0953fd4fb4faeb7d6ff6

Observation 11926f27-4162-4895-8f2b-c855a4d22f50 · outbound

This paper cites Vision-R1: Evolving Human-Free Alignment in Large Vision-Language Models via Vision-Guided Reinforcement Learning.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning Vision-R1: Evolving Human-Free Alignment in Large Vision-Language Models via Vision-Guided Reinforcement Learning

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:12.695884Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:12.695884Z digest=sha256:0444cbe4251d042e229d3a6f7c53edc2b3268bfccd8ffb66d5ae5544b79b0d9d

Observation 14e73cbf-1563-4072-b7dd-1fb2720c3fb2 · outbound

This paper cites Video-R1: Reinforcing Video Reasoning in MLLMs.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning Video-R1: Reinforcing Video Reasoning in MLLMs

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:12.708747Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:12.708747Z digest=sha256:a993a8b1e90e70470773cc3e89da9f90e5bcdedc912da655d6ebc5c62845153b

Observation 1378fa37-0922-4fe9-bf05-d13e38584077 · outbound

This paper cites Med-r1: Reinforcement learning for generalizable medical reasoning in vision-language models,.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning Med-r1: Reinforcement learning for generalizable medical reasoning in vision-language models,

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:12.715293Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:12.715293Z digest=sha256:6062aede5a83ac12ed224c3ebe5c0a035d3b615efaadd96252990f17bd138d80

Observation 427df6e0-825a-431b-9410-84e29b6a4a42 · outbound

This paper cites HuatuoGPT-o1, Towards Medical Complex Reasoning with LLMs.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning HuatuoGPT-o1, Towards Medical Complex Reasoning with LLMs

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:12.721082Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:12.721082Z digest=sha256:1ea991ea27e580201ed05d21def756127a1e63b300724be824a9812f8a134fcf

Observation cc933ffa-6545-4645-ae21-a3a1bff3e0ed · outbound

This paper cites How Abilities in Large Language Models are Affected by Supervised Fine-tuning Data Composition.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning How Abilities in Large Language Models are Affected by Supervised Fine-tuning Data Composition

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:12.727040Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:12.727040Z digest=sha256:24372825337f5279b6466e05a9256fc23ae5e94e5b1ccfefea4878487669f618

Observation 9a515ed5-d779-42ea-908a-6b772492f5c1 · outbound

This paper cites DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:12.732788Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:12.732788Z digest=sha256:7100a64fc403c59519ba7c59237a982c7cb798b0ba24d6ffd1a82de4243d8cb1

Observation 9a80e5d9-411f-4fdd-8c1a-0c49d5ae2f18 · outbound

This paper cites Aligning Large Multimodal Models with Factually Augmented RLHF.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning Aligning Large Multimodal Models with Factually Augmented RLHF

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:12.739097Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:12.739097Z digest=sha256:679c077e48db392de8a8d535fc5951e41f359ca615e28cc3cd3a0a91ce1c83dc

Observation c5d0ac4f-3bda-4696-bd88-3e959df2a637 · outbound

This paper cites Direct preference optimization: Your language model is secretly a reward model,.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning Direct preference optimization: Your language model is secretly a reward model,

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:12.745011Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:12.745011Z digest=sha256:dffc45722e9ce6aefc9369861ae53db77cf47119510707af12208cd9a98a6b9c

Observation 1cb6f7bd-1dfe-4715-881b-fbe525c78b9a · outbound

This paper cites SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:12.750753Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:12.750753Z digest=sha256:42f00318498d3057014dc9642131f8457a1961f56faccf0a804ae8dc1fb01d25

Observation 364724d7-0984-4df3-9e81-5a3c1ade3d92 · outbound

This paper cites Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:12.756251Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:12.756251Z digest=sha256:7c0fd44e58e4c073a8162a58a018dfa5a5a0c66c54c3cab5e51c539f65ca7593

Observation 05c073c1-fc3b-49ff-bc03-159e8a3a529f · outbound

This paper cites Langloc: Language-driven localization via formatted spatial description genera- tion,.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning Langloc: Language-driven localization via formatted spatial description genera- tion,

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:12:13.980112Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T23:12:12.761595Z digest=sha256:a205a2ef0c43a9d4dc6e993e137d69ec406525c6193156a8e91f500fb3e4d526

Observation f5101bf7-41c8-4e75-9dd1-4178d6f09b16 · outbound

This paper cites Qwen2.5-VL Technical Report.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning Qwen2.5-VL Technical Report

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:12.768154Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:12.768154Z digest=sha256:403457744c3c51015071263e11ace6ae6a5ac2c27d067a558651db6cf35167e2

Observation 4352587b-6c54-497e-849a-5a90884d80bb · outbound

This paper cites Surgical-vqa: Visual question answering in surgical scenes using transformer,.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning Surgical-vqa: Visual question answering in surgical scenes using transformer,

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:12:13.922312Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T23:12:12.779282Z digest=sha256:6e10178313db5eae05e366a7f03af05fabeba1bcaa24f2212ac0c076f3dd0ffd

Observation dbc56a84-e3da-4f42-b0f6-cc6eef8646df · outbound

This paper cites Beyond bilinear: Generalized multimodal factorized high-order pooling for visual question answering,.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning Beyond bilinear: Generalized multimodal factorized high-order pooling for visual question answering,

Reference 35

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:12:13.895806Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T23:12:12.784644Z digest=sha256:a65c7a3fc3ab8d9101ff28f9e4c829b513da05cc323905272d01654609230381

Observation 7c35949f-2a47-494d-85cf-98290fc3d337 · outbound

This paper cites Block: Bilinear superdiagonal fusion for visual question answering and visual relation- ship detection,.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning Block: Bilinear superdiagonal fusion for visual question answering and visual relation- ship detection,

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:12:13.872822Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T23:12:12.791470Z digest=sha256:7b6b8030baa80e6147b862ee935afef8378f135af928effe959503f0b5c1351c

Observation fb416d27-3a48-4e2d-ac3e-5d2fd8e00d98 · outbound

This paper cites Mutan: Multi- modal tucker fusion for visual question answering,.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning Mutan: Multi- modal tucker fusion for visual question answering,

Reference 37

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:12:13.854178Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T23:12:12.798619Z digest=sha256:3d67fb5ece0435d6fca798481cdbc8bd450c71b878148713acecf0febe9e5677

Observation 64124cf8-9188-46a3-8933-19be1b1d7bec · outbound

This paper cites Surgicalgpt: end- to-end language-vision gpt for visual question answering in surgery,.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning Surgicalgpt: end- to-end language-vision gpt for visual question answering in surgery,

Reference 38

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:12:13.832918Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T23:12:12.807977Z digest=sha256:f86e6f2acc3e6a252b30d0d7903c0ad071df7365d7211fa0db504355d5d0fc7d

Observation 464c2954-80a4-47f8-b714-e862ca54a132 · outbound

This paper cites 2018 Robotic Scene Segmentation Challenge.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning 2018 Robotic Scene Segmentation Challenge

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:12.816231Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:12.816231Z digest=sha256:42c4755490632cb089c9a48255f79ee21357fc796ddcbf9c1ca8d0c5480721bc

Observation 30b3032c-54da-4f24-9c6c-e35bcac52831 · outbound

This paper cites 2017 Robotic Instrument Segmentation Challenge.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning 2017 Robotic Instrument Segmentation Challenge

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:12.826059Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:12.826059Z digest=sha256:a1d7f06bd816c0cd43589e54c42a22231433cfb280fe4c170b8187c90b99c15b

Observation ada20978-0cb4-447c-8932-df36c11596fe · outbound

This paper cites A review on evaluation metrics for data classification evaluations,.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning A review on evaluation metrics for data classification evaluations,

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:12.832743Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:12.832743Z digest=sha256:61bdf9c3bcdb75ff3dd9fd02090fe02fcc7fdf76da4b06b7f0ba7d407125bb28

Observation 6470ce9e-7fcf-41e3-a7e1-6d99c2e56055 · outbound

This paper cites Generalized intersection over union: A metric and a loss for bounding box regression,.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning Generalized intersection over union: A metric and a loss for bounding box regression,

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:12.838951Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:12.838951Z digest=sha256:9dc84caf441d1a0147d8e3f82086d4cef027b9cffa3fca51701a06ba59938415

Observation ad8bc998-1407-4e1c-b31a-b1a81205c427 · outbound

This paper cites Visual instruction tuning,.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning Visual instruction tuning,

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:12.845636Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:12.845636Z digest=sha256:2ef3b67ac7124df282a634b59cd8dacdf47c89209a8adf61e68e09612241d371

Observation 94b649a3-3737-4dbc-8bd3-1c8d53c93269 · outbound

This paper cites Llava-med: Training a large language-and-vision assistant for biomedicine in one day,.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning Llava-med: Training a large language-and-vision assistant for biomedicine in one day,

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:12.850954Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:12.850954Z digest=sha256:692f31d8e676fd9182358d5eda95e8bfb39b515561ef0abc4a3b7b9d1e35aa5b

Observation c18551c6-e599-4abc-8a1d-48fd6edc248a · outbound

This paper cites Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution.

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:12.857120Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:12.857120Z digest=sha256:be9890239dd77aec6cd3056743e1a83474b29f09e779421afdef74a63a23c424

Pith citing papers

Observation a0d79053-ef30-4d96-8b51-effcfd95991b · inbound

SurgCoT: Advancing Spatiotemporal Reasoning in Surgical Videos through a Chain-of-Thought Benchmark cites this paper.

SurgCoT: Advancing Spatiotemporal Reasoning in Surgical Videos through a Chain-of-Thought Benchmark Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning

Reference 14

Resolution
verified exact
arxiv_id, observed 2026-05-11T13:36:09.445468Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-10T01:20:57.490329Z digest=sha256:01841aa2b113eab226df144f491a60f39907026e226d1efd35fbdcd47fe324ff